25 сентября 2026 г.
Gemini 3.8 Live получила видеоаватары для корпоративных диалоговых систем
Google DeepMind добавила в Gemini 3.8 Live синхронизированные с речью видеоаватары, фоновый вызов инструментов и поддержку переключения между 97 языками.
Google DeepMind 24 сентября представила Live Avatar для Gemini 3.8 Live. Функция объединяет диалоговую модель с генерацией потокового видео и уже доступна в Gemini Enterprise. Она предназначена для корпоративных виртуальных консультантов, интерактивных инструкций и других сервисов, где собеседнику требуется визуальный образ.
Аватар реагирует на изображение и речь
Live Avatar одновременно обрабатывает визуальные и звуковые входные данные. Система отвечает голосом и видео, синхронизирует движение губ с речью, воспроизводит мимику и поддерживает естественное чередование реплик.
Разработчики могут выбирать готовых персонажей с разной внешностью и голосами. Организациям также предложена настройка собственного аватара по качественному референсному изображению с сохранением внешних особенностей и фирменного стиля. Создание таких персонажей пока доступно только компаниям, получившим отдельный допуск.
| Возможность | Подтвержденное ограничение или условие |
|---|---|
| Потоковые голосовые и видеодиалоги | Доступны через Gemini Enterprise |
| Переключение между языками | Поддерживается 97 языков |
| Собственный образ аватара | Требуется корпоративный допуск |
| Фоновая работа с инструментами | Выполняется без остановки активного диалога |
Инструменты работают во время разговора
Gemini 3.8 Live может обращаться к подключенным инструментам и получать данные в фоновом режиме, пока аватар продолжает беседу. В демонстрации эта возможность используется при регистрации гостя в отеле: система ведет диалог и параллельно выполняет необходимые операции.
Для учебных платформ подобная архитектура может быть полезна при создании разговорных тренажеров, интерактивных инструкций и помощников, которые обращаются к внутренним базам данных. Однако официальный анонс описывает корпоративный продукт и не подтверждает доступность Live Avatar в обычных пользовательских аккаунтах Gemini.
Синтезированные аудио и видео получают SynthID
DeepMind сообщает, что создаваемые системой звук и видео маркируются цифровым водяным знаком SynthID. Он встраивается непосредственно в результат генерации и предназначен для последующего распознавания искусственного происхождения контента.
Перед внедрением разработчикам стоит проверить доступ к Gemini Enterprise, условия использования API и возможность подключения собственных инструментов. Отдельной проверки требуют правила работы с изображениями реальных людей, поскольку наличие технической маркировки само по себе не заменяет согласие на использование внешности.
