3 дня назад 16 сентября 2026 в 15:36 17669

Китайская компания Stepfun (阶跃星辰) официально представила семейство голосовых моделей StepAudio 3. В серию вошли пять продуктов: Realtime для полнодуплексного разговора, ASR для распознавания речи, TTS для синтеза речи, Gen для генерации звуковых эффектов и Music для создания музыкальных композиций. Флагманская модель StepAudio 3 Realtime заняла первые места в тестах DynamicSpeech и VoiceBench, которые оценивают динамику диалога и способность к голосовому рассуждению.
StepAudio 3 Realtime работает в режиме реального времени с задержкой ответа менее 300 миллисекунд. Для сравнения, голосовая версия GPT-4o от OpenAI, по данным независимых замеров, демонстрирует задержку от 500 до 800 мс в аналогичных сценариях. Модель поддерживает прерывание и естественную смену реплик, а также передачу эмоциональной окраски и интонаций. Параметры Realtime составляют около 7 миллиардов, инженеры оптимизировали её для потоковой обработки аудио через WebSocket. Архитектура опирается на мультимодальную платформу Step-2, которую ранее использовали в языковых и визуальных моделях Stepfun.
Модуль ASR достигает точности распознавания китайской речи 98,5% в стандартных тестах, включая сценарии с уличным шумом при соотношении сигнал/шум 10 дБ и региональными акцентами. Эта модель насчитывает 0,5 миллиарда параметров и использует трансформерную архитектуру с контекстным вниманием. TTS-компонент объёмом 1 миллиард параметров обучался на 50 тысячах часов речи. Он синтезирует голос с поддержкой более десяти стилей, включая нейтральный, радостный, грустный и шёпот, а также обеспечивает клонирование голоса по трёхсекундному образцу. Генеративная модель Gen создаёт звуковые эффекты по текстовому описанию — от шагов и дождя до индустриальных шумов — длительностью до 30 секунд на основе диффузионной архитектуры. Music генерирует стереофонические треки с частотой 44,1 кГц и длительностью до трёх минут, контролируя жанр, темп и инструментовку. Обучение Music проводилось на лицензионном наборе из 10 тысяч инструментальных композиций.
Бенчмарк DynamicSpeech оценивает время отклика, плавность переключения между репликами и способность обрабатывать перебивания. VoiceBench измеряет точность выполнения голосовых команд, логическую связность ответов и удержание контекста в многошаговых диалогах. В обоих тестах StepAudio 3 Realtime заняла первое место, обойдя специализированные диалоговые системы и мультимодальных конкурентов, включая GPT-4o voice. Разработчики отмечают, что StepAudio 3 способна выполнять голосовые инструкции для поиска информации, управления устройствами и генерации контента.
Семейство StepAudio 3 продолжает линейку аудиомоделей Stepfun. Компания начала работу в 2023 году, её основали выходцы из Microsoft Research Asia, ранее она выпустила мультимодальную Step-1V и языковую Step-2 с сотней миллиардов параметров. Новая серия отличается унификацией архитектуры и более тесной интеграцией с текстовыми моделями. Все пять продуктов могут работать как независимо, так и в составе комплексных голосовых ассистентов. Доступ к API открыт через облачную платформу Stepfun, модели ASR и TTS опубликовали на Hugging Face под лицензией Apache 2.0. Для развёртывания моделей требуются графические ускорители класса NVIDIA A100, Stepfun предоставляет оптимизированные контейнеры для частных облаков.
На рынке голосовых решений StepAudio 3 конкурирует с CosyVoice 2 от Alibaba, Seed-TTS от ByteDance и ChatTTS. CosyVoice 2 имеет 1,5 миллиарда параметров и поддерживает клонирование голоса, но уступает в задержке и количестве стилей. Seed-TTS фокусируется на эмоциональном синтезе, однако не включает полнодуплексный диалог. ChatTTS, открытая модель с 0,4 миллиарда параметров, проигрывает по естественности и стабильности интонации. В сравнении с GPT-4o voice, StepAudio 3 Realtime выигрывает в тестах на динамику диалога, но уступает по объёму предобученных знаний и мультиязычности. Модель Music сопоставима с MusicGen от Meta и Suno AI по качеству коротких композиций, однако ориентируется на китайский музыкальный контекст и генерирует только инструментальные треки, в отличие от Suno, который создаёт песни с вокалом.
Таким образом, Stepfun укрепляет позиции в области голосового искусственного интеллекта, предлагая единую экосистему из пяти моделей с рекордными показателями в реальном времени и синтезе.

Никто не прокомментировал материал. Есть мысли?