Компания MiniMax объявила о скором открытии исходного кода мультимодальной модели H3. Релиз назначен на 3 августа 2025 года. Модель выполняет унифицированное понимание и кросс-модальную генерацию на основе текста, изображений, видео и аудио. Максимальная продолжительность видеоролика, который создаёт система, составляет 15 секунд при разрешении 2K, при этом ролик включает синхронизированную звуковую дорожку. Разработчик акцентирует вычислительную эффективность и низкую себестоимость инференса, что улучшает экономику коммерческого развёртывания.
Архитектура H3 связывает отдельные энкодеры модальностей с общим трансформерным декодером. Такой подход позволяет преобразовывать любую входную модальность в единое скрытое представление, а затем генерировать целевой контент — видео, речь, музыку или текст. Подобная конструкция напоминает дизайн NExT-GPT, но отличается глубокой интеграцией аудиогенерации без внешнего вокодера. На рынке открытого видео до сих пор доминировали бесшумные модели. Проекты Stable Video Diffusion, Modelscope Text-to-Video, VideoCrafter2 и CogVideoX выдают видеоряд без звуковой дорожки, обычно в разрешениях от 256×256 до 720×480. Заметным шагом вперёд стала Open-Sora 2.0; эта система создаёт 16-секундные ролики в 720p, но синтез аудио вынесен в отдельный модуль и требует постобработки. MiniMax H3 впервые предлагает сквозную совместную генерацию изображения и звука высокого качества в одной открытой модели.
Согласно предварительной информации, H3 базируется на диффузионном трансформере с трёхмерным вниманием — архитектуре, напоминающей закрытую Sora от OpenAI. Open-Sora 2.0 применяет самостоятельный аудиомодуль, тогда как MiniMax интегрирует нейросетевой аудиокодек прямо в цикл шумоподавления, что обеспечивает точную синхронизацию движения губ и звуковых событий. Модель обучалась на крупномасштабном наборе видео с субтитрами и звуковыми дорожками, а для повышения вычислительной эффективности применялись дистилляция и смешанная точность. Источники в сообществе оценивают количество параметров в диапазоне 7–10 миллиардов. Такая компактность в сочетании с оптимизацией инференса обещает работу на одном графическом ускорителе класса A100 или H100 и упрощает локальное развёртывание.
Помимо генерации, H3 решает задачи мультимодального понимания: модель отвечает на вопросы по входному видео, создаёт текстовые описания сцен и распознаёт речевые команды. Таким образом она совмещает функциональность LLaVA-OneVision или Qwen-VL с продвинутым видео-аудио синтезом. Текстовая модель MiniMax-01 (релиз в январе 2025 года) показала сильные результаты в бенчмарках рассуждения и длинного контекста; наработки легли в основу H3 после добавления визуальных и акустических энкодеров.
Ожидается, что код и веса будут опубликованы под разрешительной лицензией, которая допускает свободное коммерческое использование. Это продолжает стратегию, которую ранее избрали Alibaba с моделями Qwen и Zhipu AI с ChatGLM: они выпускают открытые системы для расширения экосистемы. Детали аппаратных требований и список форматов входных данных, которые поддерживает модель, компания обещает раскрыть одновременно с открытием репозитория 3 августа. До этой даты MiniMax также планирует предоставить технический отчёт и демонстрационные примеры. Появление H3 способно сместить баланс в сегменте мультимодального ИИ, где до сих пор полноценная генерация видео со звуком оставалась прерогативой закрытых лабораторий вроде Runway и Kuaishou.
1 день назад 31 июля 2026 в 23:07 5951
