23 часа назад 8 сентября 2026 в 15:03 6734

Платформа LMSYS Chatbot Arena обновила еженедельные рейтинги моделей искусственного интеллекта в категориях генерации видео и фронтенд-разработки. Новая модель Alibaba Wan 3.0 вошла в тройку лидеров видео-арены, а языковые модели семейства Qwen и разработка Tencent улучшили позиции в зачёте фронтенд-разработки.
В сегменте генерации видео Wan 3.0 получила 1187 баллов Эло и разместилась на третьей строке. Первое место сохранила модель Sora от OpenAI со 1251 баллом, второе — Kling 2.0 от Kuaishou с 1203 баллами. Вслед за Wan 3.0 расположились Veo 2 от Google DeepMind и Runway Gen-4. Модель Alibaba построена на архитектуре Diffusion Transformer с 20 миллиардами параметров и поддерживает создание роликов разрешением до 1080p длительностью до 10 секунд по текстовому описанию или исходному изображению. В слепых попарных сравнениях пользователи Arena чаще отмечали качество передачи движения и согласованность сцен у Wan 3.0 относительно предшественницы Wan 2.2, которая занимала седьмую позицию в предыдущем отчёте.
В рейтинге фронтенд-разработки модели китайских лабораторий заняли несколько мест в первой десятке. Лидером осталась Claude 3.5 Sonnet от Anthropic с показателем 1320 баллов Эло. Модель Qwen3-Coder от Alibaba разместилась на пятой позиции, а Hunyuan-Coder от Tencent — на седьмой. Обе системы продемонстрировали способность генерировать HTML- и CSS-код, компоненты на React и Vue, а также выполнять задачи вёрстки по визуальным макетам. Методология Arena в этой дисциплине включает оценку исполняемости кода, визуального соответствия референсу и адаптивности интерфейса под мобильные разрешения.
Серия Wan развивается с начала 2024 года. Первая публичная версия Wan 2.0 использовала 14 миллиардов параметров и работала в формате текст-в-видео. Версия 2.2 добавила поддержку изображения в качестве входных данных и улучшила временную стабильность кадров. Wan 3.0 получила обновлённый кодировщик движения и трёхмерный механизм внимания, что позволило точнее обрабатывать сценарии с быстрыми перемещениями объектов и сменой ракурса. Модель доступна через облачный API Alibaba Cloud и в виде открытых весов на платформе ModelScope.
Линейка Qwen-Coder базируется на архитектуре Qwen3 с дополнительным этапом обучения на репозиториях кода и синтетических данных фронтенд-проектов. Hunyuan-Coder использует смесь экспертов и обучалась на внутренних репозиториях Tencent, а также на публичных наборах данных веб-интерфейсов. Обе модели поддерживают контекстное окно до 128 тысяч токенов и могут обрабатывать многофайловые проекты.
Платформа LMSYS Chatbot Arena формирует рейтинги на основе попарных сравнений, которые проводят анонимные пользователи. Для видео-арены участники просматривают два ролика, сгенерированных разными моделями по одинаковому промпту, и выбирают лучший по качеству, реалистичности движения и соответствию описанию. Во фронтенд-арене оцениваются сгенерированные веб-страницы и компоненты интерфейса. Баллы Эло пересчитываются еженедельно, что позволяет отслеживать динамику выхода новых версий. На момент публикации в видео-рейтинге участвовали 24 модели, во фронтенд-рейтинге — 18 моделей. Общее число сравнений в категории генерации видео превысило 90 тысяч, в категории фронтенд-разработки — 55 тысяч.

Никто не прокомментировал материал. Есть мысли?