2 дня назад 9 августа 2026 в 0:05 9635

Alibaba Cloud представила CosyVoice Studio — первую в Китае универсальную платформу для работы с голосом на базе искусственного интеллекта. Решение анонсировали в середине марта 2025 года, и до конца месяца доступ к нему открыт без оплаты. Студия объединяет три инструмента, которые закрывают полный цикл работы с речевыми данными: запись и смысловой анализ, диалоги реального времени и генерацию аудиоконтента.
Техническим фундаментом CosyVoice Studio служит собственная мультимодальная модель Alibaba Qwen‑Audio. Модель обучена на больших массивах аудиоданных и способна распознавать речь на восьми языках, включая китайский, английский, японский и корейский. Она не ограничивается транскрипцией — Qwen‑Audio идентифицирует эмоциональную окраску голоса, классифицирует неречевые события (телефонные звонки, хлопки, шум улицы) и может отвечать на вопросы по содержанию звукового фрагмента длительностью до тридцати секунд. Такая комбинация свойств выводит платформу за пределы обычных систем распознавания и даёт ей роль аудиопонимающего ядра.
Инструмент CosyFlow выполняет голосовую запись с семантическим сжатием. Он автоматически выделяет смысловые блоки из потоковой речи, исключает повторы, паузы и слова‑паразиты, а затем формирует структурированный конспект совещания или интервью. Второй компонент, CosyAgent, предназначен для реального времени: агент способен вести телефонные диалоги, принимать заказы, записывать клиентов на услуги и консультировать по типовым вопросам. Третий продукт, CosyCreative, ориентирован на создание контента — он преобразует текстовый документ, файл в формате epub или веб‑страницу в полноценную аудиокнигу с естественными интонациями и управляемым выражением эмоций.
Пользователи могут использовать десятки предустановленных голосов или активировать функцию клонирования. Её базовый алгоритм заимствован из открытой модели CosyVoice 2.0, которую Alibaba выпустила в декабре 2024 года. Для синтеза персонального голоса достаточно образца продолжительностью от трёх секунд. Технология воспроизводит тембр, темп и просодию, а также позволяет в реальном времени менять эмоциональную окраску речи — доступны нейтральный тон, радость, грусть, гнев, удивление, страх и отвращение. Веб‑студия предлагает бескодовый интерфейс, тогда как корпоративные клиенты могут задействовать программный API.
История семейства CosyVoice началась в июне 2024 года с выпуска первой версии модели для базового синтеза речи. Вторая итерация добавила улучшенный контроль эмоций и поддержку zero‑shot‑клонирования. CosyVoice Studio впервые объединяет эти наработки в единый продукт с общей моделью Qwen‑Audio и размещает платформу в публичном облаке Alibaba Cloud. По окончании бесплатного периода тарификация будет привязана к объёму синтезированного аудио либо к количеству обработанных минут диалогов; конкретные цены пока не опубликованы.
На китайском рынке аналогичные голосовые сервисы по отдельности предлагают iFlytek, Tencent Cloud и ByteDance, однако ни один из них не совмещает в одной среде захват речи, диалогового агента реального времени и генерацию аудиокниг с общей мультимодальной моделью понимания звука. Запуск CosyVoice Studio ставит Alibaba Cloud в один ряд с глобальными разработчиками голосового ИИ, такими как ElevenLabs и OpenAI, но с заметным акцентом на азиатские языки и контекстное восприятие аудиопотока.
По оценкам отраслевых экспертов, появление полноценной студии способно ускорить внедрение речевых технологий в малом бизнесе, образовании и сфере обслуживания. Alibaba Cloud формирует замкнутую экосистему, где одна платформа закрывает задачи от расшифровки созвонов до профессиональной озвучки. Учитывая открытые наработки и растущую востребованность голосовых интерфейсов в Азии, CosyVoice Studio задаёт новый инженерный и продуктовый ориентир для рынка речевого искусственного интеллекта.

Никто не прокомментировал материал. Есть мысли?