У серпні 2026 року Meta здійснила прорив у сфері децентралізованих нейронних мереж, представивши модель Muse Glimmer. Це нова архітектура штучного інтелекту, здатна запускати складних автономних агентів безпосередньо на споживчому обладнанні, такому як ноутбуки та робочі станції, без необхідності підключення до хмарних серверів. Модель, що має 30 мільярдів параметрів, стала доступною розробникам у відкритому доступі, що позначає важливий крок у демократизації штучного інтелекту.

Технологія дистиляції знань та архітектура моделі

Ключовим завданням при створенні Muse Glimmer був баланс між обчислювальною потужністю та вимогами до обладнання. Розробники хотіли створити модель, достатньо розумну для виконання складних агентських завдань, але водночас легку для запуску на пристроях з обмеженою пам'яттю. Для цього було застосовано технологію дистиляції знань від флагманської моделі-вчителя Muse Spark.

Процес навчання моделі складався з трьох критично важливих етапів:

  • Pre-Training: Початкове навчання на вихідних даних Muse Spark із застосуванням дистиляції логітів для передачі базових знань.
  • Mid-Training: Спеціалізована тренування на датасетах із довгим контекстом та складними ланцюжками міркувань, що необхідно для агентської роботи.
  • Post-Training: Комбінація донавчання (fine-tuning) та навчання з підкріпленням (RLHF), сфокусована на програмуванні, логіці та вмінні працювати з зовнішніми інструментами.

Автономність та відновлення після помилок

Muse Glimmer розроблена не просто для генерації тексту, а для виконання тривалих сценаріїв, де ШІ виступає в ролі особистого помічника. Модель демонструє високу точність у виклику функцій (function calling) за чіткими схемами в рамках багатокрокових робочих процесів.

Однією з головних особливостей є здатність до самовідновлення. У разі збою виклику інструменту модель не зупиняє роботу і не видає помилку користувачеві. Натомість вона діагностує проблему, аналізує причину збою і робить повторну спробу виконання завдання, що критично важливо для автономних агентів.

Оптимізація для споживчого заліза: K-Quant та DFlash

Запуск моделі на 30 мільярдів параметрів у повній точності вимагає понад 55 ГБ відеопам'яті, що недоступно більшості користувачів. Щоб обійти це обмеження, інженери Meta застосували дві ключові технології:

  1. Квантування K-Quant: Модель була стиснута до 4-бітного формату. Це зменшило розмір ваг до менше 20 ГБ, дозволяючи запускати її в межах 24–32 ГБ оперативної або відеопам'яті разом із KV-кешем та допоміжними модулями.
  2. Спекулятивне декодування DFlash: Використання допоміжної компактної мережі-драфтера, яка пропонує блоки токенів одразу. Це суттєво прискорює генерацію тексту на сучасних пристроях, таких як Mac із чіпами M4/M5 Max або ПК із відеокартами RTX 5090.

Екосистема та мультимодальність

Muse Glimmer підтримує мультимодальність завдяки окремому модулю сприйняття, що аналізує одночасно текст та зображення (скріншоти, графіки, документи). Модель також сумісна з популярними фреймворками для оркестрації агентів, такими як OpenClaw.

У найближчий час підтримка Muse Glimmer буде інтегрована в ключові інструменти спільноти: Ollama, LM Studio, Unsloth, а також у рушії Llama.cpp, ExecuTorch, MLX, vLLM та SGLang. Це дозволить розробникам одразу впроваджувати локальних агентів у свої додатки.