2 недели назад 2 августа 2026 в 14:12 18322

Национальная суперкомпьютерная интернет-платформа Китая открыла доступ к API-интерфейсу модели DeepSeek-V4-Flash-0731. Это первая интеграция флагманской линейки DeepSeek в инфраструктуру государственного вычислительного кластера, которая предоставляет разработчикам возможность подключаться к передовым языковым моделям без самостоятельного развертывания аппаратного обеспечения и программных сред.
Версия DeepSeek-V4-Flash-0731 представляет собой обновленный релиз семейства DeepSeek-V4. По данным, опубликованным в репозитории разработчика, архитектура модели базируется на технологии Mixture of Experts (MoE) и насчитывает 671 миллиард параметров при активном использовании 37 миллиардов на каждый токен. Такой подход позволяет балансировать между вычислительной эффективностью и качеством генерации текста. Модель поддерживает контекстное окно размером до 1 миллиона токенов, что дает возможность обрабатывать массивы информации, сопоставимые по объему с трилогией «Три тела» Лю Цысиня. В состав обновления включены агентные функции, которые обеспечивают выполнение многошаговых задач, взаимодействие с внешними инструментами и генерацию структурированных данных.
Платформа национального суперкомпьютерного интернета выступает связующим звеном между распределенными вычислительными центрами Китая и конечными пользователями. Она объединяет ресурсы крупнейших суперкомпьютеров страны, включая Tianhe и Sunway, и предоставляет их через унифицированный программный интерфейс. Запуск API для DeepSeek-V4-Flash-0731 происходит на фоне усилий Китая по импортозамещению в сфере искусственного интеллекта. В отличие от предыдущих версий, которые требовали ручной настройки окружения и загрузки весов моделей, новый сервис позволяет получить доступ к вычислительным мощностям через REST API, совместимый с распространенными клиентскими библиотеками на Python и JavaScript.
Технические характеристики DeepSeek-V4-Flash-0731 сопоставимы с показателями GPT-4 Turbo от OpenAI и Claude 3.5 Sonnet от Anthropic. В тесте MMLU, измеряющем знание 57 предметных областей, модель набирает 88,5 балла, что соответствует уровню ведущих мировых систем. В бенчмарке HumanEval, который оценивает способность генерировать программный код, результат достигает 82,6 процента. При этом стоимость инференса на платформе национального суперкомпьютерного интернета установлена на уровне 1,5 юаня за 1 миллион входных токенов и 5 юаней за 1 миллион выходных токенов. Для сравнения, использование GPT-4 Turbo через облачный сервис Alibaba Cloud обходится в 10 юаней за 1 миллион входных токенов и 30 юаней за 1 миллион выходных токенов.
Ключевым отличием версии Flash от базовой DeepSeek-V4 является оптимизация под минимальную задержку. Инженеры применили дистилляцию знаний и восьмибитное квантование для снижения времени первого токена до 0,5 секунды. Это открывает возможность применения модели в диалоговых интерфейсах реального времени, чат-ботах электронной коммерции и системах автоматической модерации контента. Агентные функции позволяют модели самостоятельно разбивать сложные запросы на подзадачи, обращаться к поисковым системам для верификации информации и выполнять математические расчеты через интеграцию с интерпретатором кода.
Предыдущее поколение DeepSeek-V3, выпущенное в декабре 2024 года, уже имело 671 миллиард параметров, но использовало иную стратегию активации экспертов и не поддерживало агентные сценарии. Переход к версии V4 ознаменовал сдвиг в сторону мультиагентных архитектур, где несколько специализированных модулей работают согласованно под управлением основного языкового ядра. Национальная суперкомпьютерная интернет-платформа также анонсировала планы по интеграции мультимодальных возможностей во втором полугодии 2025 года, что позволит обрабатывать изображения и аудиофайлы через единый API.
Разработчики из Китая и других стран могут зарегистрироваться на портале платформы, получить ключ доступа и отправить первый запрос в течение нескольких минут. Документация описывает методы для чат-комплишенов, потоковой передачи ответов и вызова функций. Поддержка стандарта OpenAPI делает миграцию проектов с других провайдеров технически простой задачей, требующей лишь замены эндпоинта и токена авторизации. Платформа гарантирует доступность сервиса на уровне 99,95 процента благодаря резервированию вычислительных узлов в трех географически разделенных центрах обработки данных.

Никто не прокомментировал материал. Есть мысли?