10 часов назад 25 сентября 2026 в 15:23 3626

Компания Google представила языковую модель Gemini 3.8 Live с функцией Live Avatar для генерации интерактивных виртуальных персонажей в реальном времени. Система объединяет синтез видео и голоса, обеспечивает синхронизацию движения губ, естественную мимику и поддержку 97 языков. Модель ориентирована на корпоративных клиентов для создания виртуальных помощников. Внедрён механизм безопасного локального водяного знака SynthID.
Согласно технической документации, опубликованной в репозиториях разработчиков, Gemini 3.8 Live базируется на мультимодальной архитектуре семейства Gemini 2.5, но включает отдельный модуль генерации видеоаватаров. В основе модуля лежит диффузионная модель, обученная на наборах данных с мимикой и артикуляцией для 97 языков. Потоковая обработка позволяет формировать видеоряд с частотой 30 кадров в секунду при задержке менее 200 миллисекунд на тензорных процессорах TPU v5p. Голосовой тракт использует усовершенствованный кодировщик SoundStream с частотой дискретизации 24 кГц, что обеспечивает передачу интонаций и пауз без артефактов сжатия.
Функция Live Avatar создаёт виртуального собеседника, который реагирует на запросы пользователя в реальном времени. Система анализирует входной текст или голос, генерирует ответ языковой моделью и параллельно формирует видеопоток с анимированным лицом. Синхронизация губ достигается за счёт предсказания фонем из выходного аудиосигнала и их отображения на трёхмерную модель лица с последующей проекцией на двумерное изображение. Мимика управляется вектором эмоциональных параметров, который модель извлекает из контекста диалога. Поддержка 97 языков охватывает основные языковые группы, включая языки с нелатинской письменностью и тоновые языки Юго-Восточной Азии.
Для сравнения, представленный в мае 2024 года мультимодальный ассистент GPT-4o от OpenAI предлагает голосовое взаимодействие с элементами анализа видео с камеры, но не генерирует антропоморфный аватар в реальном времени. Решение Microsoft для Teams использует аватары на основе заранее записанных движений, а не потокового синтеза. Платформа Synthesia генерирует видео с цифровыми персонажами по тексту, однако требует времени на рендеринг и не работает в интерактивном режиме. Таким образом, Gemini 3.8 Live занимает нишу потоковой генерации анимированных помощников с малой задержкой.
Линейка Gemini развивается с декабря 2023 года, когда Google представила первую мультимодальную модель Gemini 1.0. Версия 2.0 Flash получила возможность прямой трансляции видео и аудио в режиме реального времени. Модель 2.5 Pro добавила улучшенное логическое мышление и контекстное окно до одного миллиона токенов. Gemini 3.8 Live продолжает эту траекторию, делая акцент на синхронной генерации аватаров для бизнес-применений. Корпоративные клиенты получат доступ через платформу Vertex AI и интерфейс API для интеграции в колл-центры, виртуальные приёмные и обучающие системы.
Важным элементом является водяной знак SynthID, встроенный непосредственно в видеопоток. Технология от Google DeepMind накладывает незаметные для глаза метки на уровне пикселей и аудиодорожки, что позволяет идентифицировать синтезированный контент даже после перекодирования или съёмки с экрана. В отличие от серверных решений, в Gemini 3.8 Live водяной знак наносится локально на устройстве вывода без увеличения задержки. Это отвечает требованиям корпоративной безопасности и политик ответственного использования искусственного интеллекта.
Дополнительные сведения из документации для разработчиков указывают, что модель поддерживает кастомизацию внешности аватара через загрузку эталонного изображения. Система адаптирует черты лица, сохраняя естественность движений. Доступна настройка стиля одежды и фона с помощью текстового описания. При этом Google вводит ограничения на генерацию лиц публичных фигур без согласия, что реализовано через фильтры на этапе обучения и классификаторы в рантайме. Первыми партнёрами для пилотного внедрения стали несколько крупных финансовых организаций и телекоммуникационных компаний, названия которых пока не раскрываются. Публичный запуск для разработчиков ожидается в четвёртом квартале 2025 года.

Никто не прокомментировал материал. Есть мысли?