21 час назад 30 августа 2026 в 11:11 5957

Компания Zhipu AI объявила о публикации в открытом доступе большой языковой модели нового поколения GLM-5.3-Flash. Решение построено на архитектуре смеси экспертов (Mixture of Experts, MoE) с общим числом параметров 320 миллиардов и 18 миллиардами активных параметров на один токен. Модель изначально разрабатывалась как нативно-мультимодальная и способна обрабатывать текст и изображения без привлечения внешних модулей-трансляторов. Выпуск состоялся спустя несколько месяцев после появления предшественника GLM-4-Plus, который имел схожую структурную организацию, но уступал новинке по плотности мультимодального контекста.
Архитектура MoE позволила разработчикам распределить вычислительную нагрузку между множеством специализированных подсетей-экспертов, активируя лишь малую долю полного веса модели при обработке каждого запроса. Такой подход обеспечивает баланс между высокой емкостью нейросети и умеренным потреблением ресурсов на этапе инференса. В тестах MMLU-Pro, LiveCodeBench и ряде бенчмарков на понимание изображений модель демонстрирует результаты, сопоставимые с показателями GPT-4o и Claude 3.5 Sonnet, а в задачах на генерацию кода приближается к уровню DeepSeek-V3. При этом заявленная стоимость токена остается кратно ниже тарифов проприетарных аналогов сопоставимого класса точности.
Исходные веса GLM-5.3-Flash размещены на платформе Hugging Face под разрешительной лицензией MIT, что допускает коммерческое использование, модификацию и распространение производных продуктов без дополнительных отчислений. Вместе с весами опубликован сопровождающий технический отчет, в котором детализированы этапы предобучения, процедуры выравнивания и методики подавления галлюцинаций. Особое внимание уделено работе с длинным контекстом: модель поддерживает окно до 128 тысяч токенов, что позволяет обрабатывать объемные документы и многостраничные технические спецификации без фрагментации входных данных.
Нативная мультимодальность реализована через единый трансформерный энкодер, который принимает пиксельные патчи изображений вместе с текстовыми эмбеддингами на раннем этапе обработки. Это устраняет необходимость в промежуточном преобразовании картинки в текстовое описание перед подачей в языковое ядро и дает выигрыш в задачах визуального ответа на вопросы, распознавания рукописного ввода и анализа графиков. По информации из репозитория проекта, для запуска полной версии требуется как минимум восемь ускорителей NVIDIA H100 или эквивалентное количество GPU с объемом памяти от 80 гигабайт каждый. Для случаев ограниченного бюджета команда предлагает квантованные сборки, снижающие требования к видеопамяти до уровня одного сервера с четырьмя потребительскими картами.
Публикация GLM-5.3-Flash продолжает стратегию Zhipu AI по формированию открытой экосистемы вокруг семейства ChatGLM. Ранее компания уже выпускала свободные версии GLM-4-9B и CodeGeeX, что способствовало их интеграции в сторонние инструменты разработчика и образовательные платформы. Параллельно с выходом новой модели сообщество запустило несколько форков для адаптации под периферийные устройства и ведется работа над портированием на фреймворк llama.cpp, что должно расширить совместимость с локальными средами исполнения без привязки к облачным API.

Никто не прокомментировал материал. Есть мысли?