Компания Meta Platforms 14 апреля разместила на платформе Hugging Face веса большой языковой модели Muse Glimmer, насчитывающей 30 миллиардов параметров. Проект опубликован под лицензией Apache 2.0 и ориентирован на агентные сценарии — браузинг, вызовы API и многошаговое планирование. Основной релиз занимает порядка 60 гигабайт в FP16, однако разработчик сразу предоставил официальные 4-битные квантованные сборки в формате GPTQ, которые сокращают объём до 17,8 гигабайт. Это позволяет целиком загрузить модель на один графический процессор с 24 гигабайтами видеопамяти, такой как NVIDIA GeForce RTX 3090, RTX 4090 или профессиональный ускоритель A5000. На оборудовании Apple с чипами M2 Ultra и 32 гигабайтами унифицированной памяти инференс также проходит локально через фреймворк llama.cpp с поддержкой Metal.
Архитектура Muse Glimmer представляет собой декодерный трансформер, использующий групповое внимание с запросом (GQA) и позиционное кодирование RoPE. Длина контекста достигает 32768 токенов. Модель обучали на смеси открытых и лицензионно чистых текстовых данных общим объёмом около 4 триллионов токенов. Тренировочный пайплайн включал этап контролируемого файнтюнинга и дополнительную настройку на разметке для работы с инструментами, что и выделяет новинку на фоне базовых генеративных моделей Meta. Согласно карточке на Hugging Face, разработчики адаптировали Muse Glimmer под популярные среды исполнения — vLLM, ExLlamaV2 и LM Studio.
Метрики, полученные независимым сообществом в первые часы после публикации, помещают модель в одну группу с близкими по размеру аналогами. В тесте MMLU достигнуто значение 75,8 процента, что практически совпадает с результатом Gemma-2-27B от Google (75,2 процента) и превосходит показатели Falcon-40B. На задачи генерации кода HumanEval Muse Glimmer набирает 68 процентов, обходя Gemma-2-27B и лишь незначительно уступая Qwen2.5-32B. В бенчмарках логических рассуждений HellaSwag и GSM8K расхождения с флагманскими моделями такого же класса не превышают трёх процентных пунктов. При этом пиковая пропускная способность на RTX 4090 с 4-битным квантованием составляет примерно 45 токенов в секунду, а энергопотребление находится в пределах штатного теплопакета карты.
Выбор имени Muse нуждается в контексте. Прежде Meta использовала бренд Muse для семейства моделей генерации изображений на недиффузионном трансформере, выпущенного летом 2023 года. Нынешний шаг означает возвращение марки, но уже в сегмент текстовых моделей. Генеральная линейка Llama при этом не участвует в релизе: в портфеле Meta сейчас доступны Llama 3.1 и 3.2 с параметрами от 8 до 70 миллиардов, а также прошлогодние Llama-2 и Code Llama. Прямого аналога на 30 миллиардов параметров в семействе Llama ранее не существовало — ближайшей по размеру была Llama-1-33B, выпущенная по исследовательской лицензии и снятая с официальной поддержки. Появление Muse Glimmer под полностью разрешительной Apache 2.0 закрывает эту нишу и даёт корпоративным пользователям возможность коммерческого развёртывания без ограничений.
Сообщество локального инференса уже адаптирует модель под квантованные форматы GGUF и AWQ, публикуя сборки I‑Quants и статичные 4-битные чанки на Hugging Face. На форумах r/LocalLLaMA отмечают низкий порог входа: файл размером менее 20 гигабайт копируется на съёмный SSD и запускается на ноутбуке с дискретной графикой. Обозреватели из Tom’s Hardware и Ars Technica фиксируют стабильную работу агентных сценариев уже на пороговых 24 гигабайтах памяти без обращения к облачным API. В отличие от Falcon-180B или Mixtral-8x22B, требующих кластерной экосистемы, Muse Glimmer удерживает полный пайплайн инструментального вызова внутри одной потребительской видеокарты, что повторяет опыт развёртывания Yi-34B и Qwen2.5-32B, однако с меньшим потреблением памяти и без необходимости офлоада части слоёв в оперативную память. Таким образом, Meta предлагает рынку открытую модель, которая нацелена на практическую автоматизацию задач и не нуждается в дорогостоящей серверной инфраструктуре.
23 часа назад 11 августа 2026 в 10:18 4882
