2 дня назад 7 октября 2026 в 15:50 11749

Компания Mistral AI представила мультимодальную модель Mistral Large 4. Модель обучалась полностью в европейских дата-центрах, принадлежащих самой Mistral AI. Вычислительная инфраструктура построена на ускорителях NVIDIA Grace Blackwell. Компания подчеркивает, что тренировочный цикл не зависел от внешних облачных провайдеров и проходил на собственных кластерах.

Mistral Large 4 ориентирована на корпоративные сценарии. В документации указаны три ключевые области применения: кибербезопасность, финансовый анализ и юридическая обработка текстов. По внутренним замерам разработчика модель достигает уровня SOTA среди открытых систем в этих сегментах. Прямые количественные сравнения с Llama 3.1 405B, DeepSeek V3 и Qwen 2.5 в анонсе не раскрыты, однако Mistral AI заявляет о преимуществе в задачах длинного контекста и многошагового рассуждения.

Архитектура поддерживает обработку изображений, текста и документов в едином контекстном окне. Входной контекст расширен до 256 тысяч токенов. Выходной лимит составляет 32 тысячи токенов на запрос. Поддерживаются английский, французский, немецкий, испанский, итальянский, португальский, нидерландский, польский, арабский, хинди и русский языки.

Доступ к предварительной версии открыт через API la Plateforme. Для тестирования доступна конечная точка с идентификатором mistral-large-2407. Параллельно модель интегрирована в чат-интерфейс Le Chat. Провайдеры облачных сервисов могут развернуть образ через Hugging Face после публикации весов. Лицензия для коммерческого использования будет объявлена вместе с файлами параметров.

По сравнению с предыдущим поколением Mistral Large 2 объём параметров вырос с 123 миллиардов до одного триллиона. При этом разработчик сообщает о снижении стоимости инференса на сорок процентов за счёт применения разреженной архитектуры MoE. Активными при обработке одного токена остаются примерно двенадцать процентов параметров. Это позволяет удерживать задержку на уровне моделей с плотной архитектурой в диапазоне 70–110 миллиардов параметров.

В бенчмарке MMLU Pro предварительная версия набирает 81,2 процента. В тесте HumanEval для генерации кода результат составляет 92,4 процента. Для сравнения, Llama 3.1 405B показывает 73,3 процента в MMLU Pro и 89,0 процента в HumanEval. Mistral Large 4 также обходит GPT-4o в специализированном наборе FinanceBench на 3,1 процентного пункта, но уступает Claude 3.5 Sonnet в задачах юридического анализа на 1,8 пункта.

Открытие весов запланировано на тридцатое августа. До этой даты компания собирает отзывы от корпоративных клиентов и исследовательских групп. После публикации параметров сторонние разработчики смогут выполнять дообучение и дистилляцию без ограничений на размер конечной модели. Mistral AI продолжает линию открытых релизов, начатую с Mistral 7B в сентябре 2023 года.

Никто не прокомментировал материал. Есть мысли?