2 дня назад 13 августа 2026 в 18:30 10450

Сообщество ModelScope объявило об открытии весов модели Qwen3.8-2.4T-A95B. Разработчиком выступила команда Qwen из Alibaba Cloud. В сообщении отмечено, что это первая открытая модель уровня Qwen-Max. Ранее флагманская система Qwen-Max была доступна только по интерфейсу прикладного программирования, теперь веса опубликованы для локального развертывания, дообучения и исследовательских задач.
Модель использует смешанную экспертную архитектуру. Общий объём параметров равен 2,4 триллиона. На каждый токен активируется 95 миллиардов параметров. Обозначение A95B в названии указывает на это значение. Такой принцип снижает объём вычислений на токен по сравнению с плотной моделью того же полного масштаба, так как при обработке данных работает только часть экспертов. Исходная длина контекстного окна составляет 262 144 токена. Это значение позволяет уместить в одном окне крупный репозиторий кода, длинную проектную документацию или многошаговую трассу действий программного агента.
Направление модели связано с программированием и агентными задачами. В таблицах бенчмарков, которые сопровождают выпуск, рост зафиксирован в тестах на генерацию кода, отладку, выполнение многошаговых инструкций и вызовы внешних инструментов. Разработчики подчёркивают пригодность модели для сценариев, где требуется последовательное взаимодействие с файловой системой, командной строкой или интерфейсами прикладного программирования. Общие результаты зависят от конфигурации запуска, длины контекста и способа квантования.
Выпуск продолжает открытую линейку Qwen. Прежние открытые модели этого семейства имели меньший общий и активный объём параметров, а самые производительные варианты оставались закрытыми. Для сравнения, открытая модель DeepSeek-V3 использует 671 миллиард общих и 37 миллиардов активных параметров, тогда как новая модель Qwen активирует 95 миллиардов параметров на токен. Разница в общем объёме и доле активных экспертов определяет другую точку баланса между качеством ответа и вычислительными затратами.
Доступ к весам предоставлен на платформе ModelScope и в репозитории Hugging Face. Файлы опубликованы в формате, который совместим с основными инструментами для работы с большими языковыми моделями. Для полного запуска требуется серверная конфигурация с несколькими ускорителями и достаточным объёмом памяти. При этом смешанная экспертная архитектура даёт возможность выбирать конфигурацию инференса с учётом доступных ресурсов. На практике длинный контекст увеличивает нагрузку на память, поэтому при обработке сотен тысяч токенов применяют распределение по устройствам или квантование.
Открытые веса распространяются по лицензии Apache 2.0. Она допускает коммерческое использование и адаптацию. Это отличает публикацию от API-доступа, при котором параметры модели остаются на стороне провайдера. Локальный запуск снимает ограничения на передачу данных внешним сервисам и позволяет проводить аудит поведения модели. Вместе с тем развёртывание системы такого масштаба требует инженерных ресурсов и вычислительной инфраструктуры.
Публикация имеет значение для рынка открытых моделей. До сих пор модели уровня флагманских API обычно не раскрывали веса. Открытие Qwen3.8-2.4T-A95B создаёт условия для сборки специализированных версий на базе крупной MoE-архитектуры без необходимости собирать модель с нуля. Одновременно ассортимент открытых моделей Qwen охватывает устройства от малых конфигураций до серверных кластеров, что упрощает перенос решений между разными по мощности платформами.

Никто не прокомментировал материал. Есть мысли?