1 час назад 29 августа 2026 в 11:06 482

Alibaba Cloud через подразделение Tongyi Qianwen опубликовала веса и технический отчет модели Qwen3.8-Flash-Next. Разработка относится к семейству Qwen и распространяется по открытой лицензии. Модель построена по архитектуре Mixture of Experts с общим объемом 125 миллиардов параметров, при этом на каждый токен активируется около 6 миллиардов параметров. Такой подход направлен на снижение вычислительной нагрузки во время инференса без пропорционального сокращения емкости модели.
Ключевое техническое изменение в Qwen3.8-Flash-Next касается механизма обработки последовательностей. Инженеры внедрили гибридный слой, который объединяет стандартный механизм внимания Query-Key-Value с блоком Gated DeltaNet и техникой квантизации состояния ассоциативной памяти QSA. Gated DeltaNet представляет собой рекуррентную структуру, оптимизированную для эффективного обновления скрытого состояния при работе с длинными текстами. В отличие от традиционных Transformer-блоков, которые требуют квадратичных вычислительных затрат относительно длины контекста, компонент DeltaNet обеспечивает линейную зависимость от размера входных данных. Это позволяет сохранять стабильное потребление памяти при обработке расширенных контекстных окон.
Согласно сопроводительным материалам, модель нацелена на значительное улучшение работы с длинными документами и снижение затрат на этапе обучения. В архитектуре часть слоев внимания заменена на модули Gated DeltaNet, что уменьшает количество матричных умножений на длинных дистанциях. Механизм QSA дополнительно сжимает представление прошлых состояний через дискретизацию скрытых векторов, ограничивая рост объема занимаемой видеопамяти в задачах языкового моделирования и генерации.
По сравнению с предыдущей версией Qwen2.5-Flash, которая использовала классическую плотную архитектуру или более простые варианты MoE, новая модификация демонстрирует иной баланс между глубиной переработки контекста и скоростью вывода. Модели серии Qwen2.5 требовали полного пересчета матрицы совместимости для всех позиций, тогда как текущая версия способна выборочно обновлять состояние через дельта-правило. Это роднит подход с архитектурами типа Mamba или RWKV, однако Alibaba сохранила гибридную схему с частичным сохранением точечного внимания для задач, где важен прямой доступ к произвольным фрагментам текста.
Публикация весов сопровождается техническим отчетом, в котором детализированы конфигурации слоев, расписание обучения и метрики на бенчмарках. Модель доступна для загрузки через официальные репозитории Qwen на платформах Hugging Face и ModelScope. Разработчики могут использовать стандартные фреймворки, включая Transformers и vLLM, с адаптацией под кастомные операции DeltaNet. Открытая лицензия разрешает коммерческое использование и дообучение.
Выпуск Qwen3.8-Flash-Next продолжает тенденцию интеграции рекуррентных элементов в большие языковые модели. Аналогичные исследования ведут другие лаборатории: например, модель RecurrentGemma от Google DeepMind также использует линейные рекуррентные блоки вместо полноценного self-attention для экономии ресурсов. Решение Alibaba Cloud выделяется применением стробирующего дельта-правила в сочетании с квантованным состоянием, что потенциально повышает точность воспроизведения редких фактов в середине длинных документов. Прямое сравнение на стандартных тестах длинного контекста, таких как Needle-in-a-HayStack и RULER, покажет, насколько гибридный дизайн превосходит как чисто трансформерные, так и полностью рекуррентные аналоги при активации всего шести миллиардов параметров.

Никто не прокомментировал материал. Есть мысли?