24 сентября 2026 г.
Google DeepMind представила Gemini 3.8 Flash TTS для управляемой генерации речи
Gemini 3.8 Flash TTS и Flash-Lite TTS создают выразительные голоса, диалоги и аудиосцены. Разбираем функции, ограничения доступа и значение для учебных и исследовательских проектов.

Google DeepMind 23 сентября представила две модели синтеза речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Они рассчитаны на создание выразительных голосов, управляемых диалогов и аудиосцен. Модели доступны через Google AI Studio и Gemini API, а также используются в отдельных продуктах Google, включая Gemini Notebook и Google Vids.
Голос можно задавать с нуля
Новые модели переводят синтез речи от выбора готового пресета к описанию нужного персонажа. Пользователь может задать акцент, тембр, эмоциональную подачу и манеру произношения. В демонстрациях Google показала голоса радиоведущего, монотонного робота и фантастического персонажа.
Отдельный режим предназначен для сцен с двумя участниками. Автор задаёт реплики и направление исполнения для каждой строки, включая паузы, интонацию и очередность разговора. Такой подход подходит для озвучки учебных роликов, подкастов, презентаций, игровых прототипов и языковых упражнений.
Основные возможности моделей
| Возможность | Что заявила Google DeepMind |
|---|---|
| Настройка голоса | Создание новых голосовых персонажей по текстовому описанию |
| Управление сценой | Направление реплик, интонаций и смены говорящих |
| Языки | Поддержка более 100 языков |
| Защита аудио | Маркировка SynthID для распознавания сгенерированной речи |
| Копирование голоса | Требуется голосовая запись согласия владельца |
Google DeepMind также сообщила о результатах внутренних сравнений с участием Hume AI Voice Design Benchmark и Voice Arena. Компания заявляет о высоких позициях Gemini 3.8 Flash TTS и Flash-Lite TTS по настройке голоса, акцентам и общей оценке качества. Эти показатели описывают результаты представленных компанией тестов, поэтому их нельзя автоматически переносить на любой учебный или коммерческий сценарий.
Что проверить перед использованием
Для курсовой, исследовательского прототипа или презентации модель может пригодиться, когда нужно озвучить текст, создать диалоговый пример или подготовить многоязычную аудиоверсию материала. Автору стоит отдельно проверить правильность произношения терминов, имён и названий, а также сохранить исходный сценарий и пометить использование синтетической речи.
Google указывает, что каждый аудиоклип Gemini Audio получает незаметную водяную метку SynthID. Для копирования голоса требуется подтверждение согласия его владельца. При этом функция voice replication через AI Studio недоступна в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии. Перед началом работы нужно проверить доступность конкретной функции для своего аккаунта, тарифа и региона.