В августе 2026 года Meta совершила прорыв в области децентрализованных нейросетей, представив модель Muse Glimmer. Это новая ИИ-архитектура, способная запускать сложных автономных агентов непосредственно на потребительском оборудовании, таких как ноутбуки и рабочие станции, без необходимости подключения к облачным серверам. Модель, обладающая 30 миллиардами параметров, стала доступна разработчикам в открытом доступе, что знаменует собой важный шаг в демократизации искусственного интеллекта.
Технология дистилляции знаний и архитектура модели
Ключевой задачей при создании Muse Glimmer был баланс между вычислительной мощностью и требованиями к оборудованию. Разработчики хотели создать модель, достаточно умную для выполнения сложных агентных задач, но при этом легкую для запуска на устройствах с ограниченной памятью. Для этого была применена технология дистилляции знаний от флагманской модели-учителя Muse Spark.
Процесс обучения модели состоял из трех критически важных этапов:
- Pre-Training: Начальное обучение на исходных данных Muse Spark с применением дистилляции логитов для передачи базовых знаний.
- Mid-Training: Специализированная тренировка на датасетах с длинным контекстом и сложными цепочками рассуждений, что необходимо для агентной работы.
- Post-Training: Комбинация fine-tuning и обучения с подкреплением (RLHF), сфокусированная на программировании, логике и умении работать с внешними инструментами.
Автономность и восстановление после ошибок
Muse Glimmer разработана не просто для генерации текста, а для выполнения длительных сценариев, где ИИ выступает в роли персонального помощника. Модель демонстрирует высокую точность в вызове функций (function calling) по четким схемам в рамках многошаговых рабочих процессов.
Одной из главных особенностей является способность к самовосстановлению. При сбое вызова инструмента модель не останавливает работу и не выдает ошибку пользователю. Вместо этого она диагностирует проблему, анализирует причину сбоя и делает повторную попытку выполнения задачи, что критически важно для автономных агентов.
Оптимизация для потребительского железа: K-Quant и DFlash
Запуск модели на 30 миллиардов параметров в полной точности требует более 55 ГБ видеопамяти, что недоступно большинству пользователей. Чтобы обойти это ограничение, инженеры Meta применили две ключевые технологии:
- Квантование K-Quant: Модель была сжата до 4-битного формата. Это уменьшило размер весов до менее 20 ГБ, позволяя запускать её в пределах 24–32 ГБ оперативной или видеопамяти вместе с KV-кэшем и вспомогательными модулями.
- Спекулятивное декодирование DFlash: Использование вспомогательной компактной сети-драфтера, которая предлагает блоки токенов сразу. Это существенно ускоряет генерацию текста на современных устройствах, таких как Mac с чипами M4/M5 Max или ПК с видеокартами RTX 5090.
Экосистема и мультимодальность
Muse Glimmer поддерживает мультимодальность благодаря отдельному модулю восприятия, анализирующему одновременно текст и изображения (скриншоты, графики, документы). Модель также совместима с популярными фреймворками для оркестрации агентов, такими как OpenClaw.
В ближайшее время поддержка Muse Glimmer будет интегрирована в ключевые инструменты сообщества: Ollama, LM Studio, Unsloth, а также в движки Llama.cpp, ExecuTorch, MLX, vLLM и SGLang. Это позволит разработчикам сразу внедрять локальных агентов в свои приложения.