Платформа Chatbot Arena от LMSYS представила регулярный рейтинг языковых и визуальных моделей за 31-ю неделю. Сводки зафиксировали заметное перемещение китайских разработок. Модель Alibaba Qwen3.8-Max дебютировала сразу на пятой строке общего зачета, а генеративная нейросеть ByteDance Seedream 5.0 Pro поднялась на шестую позицию в категории создания изображений.
Chatbot Arena — независимая краудсорсинговая система оценки, в которой пользователи анонимно сравнивают ответы моделей. Каждую неделю обновляются лидерборды, которые отражают пользовательские предпочтения. На момент 31-й недели в общем зачете уверенно лидировали GPT-4o (OpenAI) и Claude 3.5 Sonnet (Anthropic), за ними следовала Gemini 1.5 Pro. Четверку замыкала Meta Llama 3.2 405B. Qwen3.8-Max сместила ряд конкурентов и заняла пятое место.
Флагманская модель серии Qwen компании Alibaba Cloud использует архитектуру смеси экспертов с сотнями миллиардов параметров. Точное число разработчики не раскрывают. По данным сообщества, модель обучали на массиве, который превышает 20 триллионов токенов, с акцентом на многоязычность и логические рассуждения. В бенчмарках MMLU-Pro и HumanEval модель достигла результатов на уровне GPT-4o и Claude 3.5. Предшественник Qwen3-Max находился за пределами первой десятки общего рейтинга Arena, поэтому скачок до пятого места стал заметным событием.
Линейка Qwen развивается с 2023 года. Первая версия Qwen-7B не входила в мировые топы. С выходом Qwen2.5 в 2024 году компания приблизилась к лидерам. Модель Qwen3-Max вышла в марте 2025 года и уже использовала MoE-архитектуру, однако Qwen3.8-Max совершил качественный прорыв благодаря улучшенному сэмплированию данных и дообучению с подкреплением на основе обратной связи человека (RLHF). Для RLHF применили выборку из двух миллионов сравнений, что повысило согласованность с предпочтениями пользователей и точность ответов в сложных диалоговых сценариях.
В категории генерации изображений Seedream 5.0 Pro от ByteDance поднялась с девятого на шестое место. Модель обучена на наборе из 2,5 миллиарда изображений, использует diffusion-transformer гибридной архитектуры и поддерживает разрешение до 2048×2048 пикселей. Ключевые характеристики — точное следование текстовым описаниям, фотореалистичная передача лиц и интеграция с экосистемой Doubao. Конкурирует она с Midjourney 6.1, DALL-E 4 и Stable Diffusion 3.5 Ultra. Предыдущая версия Seedream 4.0 уступала Midjourney 6 в текстовой когерентности и страдала от искажений при генерации сложных сцен. В версии 5.0 Pro инженеры внедрили механизм кросс-внимания с динамической маскировкой, что повысило качество на 18% по метрике HPSv2. В рейтинге Arena модель обошла Playground 2.5 и приблизилась к DALL-E 4.
Аналитики отмечают, что резкое улучшение позиций китайских моделей отражает тренд на сокращение отрыва от американских лидеров. Платформа Arena также обновила рейтинг для узких задач, включая написание кода и обработку длинных контекстов. Успех Qwen3.8-Max связывают с оптимизацией MoE-архитектуры и увеличением окна контекста до 200 тысяч токенов. Этот параметр критически важен для анализа больших документов и научных статей.
Помимо Alibaba и ByteDance, заметный прогресс показала модель DeepSeek-R1. Она закрепилась в десятке лидеров. Разработка 01.AI Yi-Lightning также улучшила показатели в задачах на рассуждение. Общий зачет Arena демонстрирует, что четыре из десяти лидирующих моделей созданы в Китае. Ожидается, что к концу года Alibaba и ByteDance представят обновленные мультимодальные системы. По предварительным данным, следующие версии смогут нативно обрабатывать аудио и видео, что изменит расстановку сил на лидербордах.
5 часов назад 3 августа 2026 в 19:06 1222
