1 день назад 29 июля 2026 в 12:47 7020

Компания AGIBOT (Shanghai Zhiyuan New Power Technology) сообщила о выходе мультимодальной языковой модели WITA-Omni Preview на первую позицию в международном рейтинге DailyOmni. Разработка набрала 85,21 балла. В зачете бенчмарка она обошла мультимодальные системы Gemini (Google), NVIDIA и Qwen2.5-Omni (Alibaba). Бенчмарк DailyOmni оценивает способность искусственного интеллекта к синхронному анализу аудио- и видеопотоков в реальном времени, выстраиванию сложных временных причинно-следственных связей и распознаванию пространственных сценариев.
Архитектурной основой решения служит сквозная система Thinker-Talker-Actor. Данная архитектура разработана компанией специально для прецизионного управления действиями и лицевой мимикой человекоподобных роботов. Интеграция модели нацелена на функционирование гуманоидных платформ AGIBOT в динамической среде. Выход WITA-Omni Preview состоялся 15 апреля текущего года. Модель способна обрабатывать входящие изображения, видеофрагменты и аудиоданные, генерируя речевые ответы с одновременным управлением моторикой оборудования в реальном масштабе времени.
Технический стек модели опирается на гибридный подход к мультимодальному слиянию. В отличие от популярных каскадных схем, где распознавание речи предшествует языковому анализу, WITA-Omni Preview использует end-to-end архитектуру (сквозное обучение). Это позволяет сократить задержки между получением визуального сигнала и выдачей моторной команды. Разработчики применили механизм стримингового кодирования аудио без сегментации фраз, что сохраняет непрерывность диалога и позволяет роботу реагировать на прерывание речи или изменение окружающей обстановки быстрее человеческого времени реакции. Моторный актуатор при этом координирует 28 степеней свободы лицевой маски гуманоида, синхронизируя артикуляцию губ с исходящим речевым сигналом.
Помимо лидерства в DailyOmni, модель показала конкурентные метрики в ряде других оценочных наборов данных. В бенчмарке MMBench, тестирующем понимание визуальных сцен, результат достиг 85,3 балла. В DocVQA, предназначенном для ответов на вопросы по текстовым документам, показатель составил 91,7 балла. Это ставит одномодальные текстовые способности модели на уровень специализированных языковых решений при сохранении расширенного мультимодального ввода.
Конкурирующие платформы демонстрируют смежные результаты в отдельных категориях. Модель Qwen2.5-Omni от Alibaba, занимавшая до этого высокие строчки, делает акцент на универсальной потоковой обработке видео и речи, но меньше ориентирована на прямой привод робототехнических актуаторов. Решения NVIDIA фокусируются на симуляциях и обучении манипуляторов в виртуальных средах. Gemini от Google демонстрирует глубокое понимание длинных видеорядов, однако при тестировании сценариев, критичных к задержкам управления мимикой, архитектура AGIBOT показала превосходство благодаря жесткой связке модулей мышления, речи и активации движений.
Платформа WITA-Omni Preview также прошла тестирование на задачах оптического распознавания символов и распознавания поведения в сложном окружении. При обработке видео сверхвысокой четкости с одновременным звуковым рядом инженеры добились стабильной работы на аппаратном обеспечении, интегрируемом непосредственно в грудной вычислительный модуль гуманоида. Вычислительная нагрузка позволяет удерживать частоту принятия решений на уровне, необходимом для безопасной навигации в помещении с людьми и выполнения сборочных операций. По данным открытой публикации на платформе Hugging Face, массового открытия весов модели для сторонних разработчиков пока не производилось, однако компания интегрировала превью-версию в свои последние прошивки для тестовых партий роботов семейства Lingxi.
Замеры производительности в DailyOmni включали многозадачные сессии распознавания мимики собеседника, оценки расстояния до источника звука и поддержания визуального контакта во время манипуляций с объектами. Результат в 85,21 балла демонстрирует отрыв от референсных показателей конкурентов более чем на несколько процентных пунктов. Инженеры AGIBOT связывают это с внедрением механизмов перекрестного внимания между визуальными токенами, звуковым рядом и временными метками актуатора. Дальнейшие итерации модели, по планам компании, будут расширять тактильную модальность для полного симуляционного контура обратной связи при силовом захвате предметов.

Никто не прокомментировал материал. Есть мысли?