15 сентября 2026 г.
Google DeepMind представила Gemini 3.8 Live для голосовых задач и фоновых действий
Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking получили обработку визуального контекста, переключение между 97 языками и выполнение фоновых действий во время разговора.

Google DeepMind 15 сентября представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Новые модели рассчитаны на голосовые сценарии, в которых пользователь может продолжать разговор, пока система анализирует визуальный контекст, обращается к инструментам или выполняет многошаговую задачу в фоне. Доступ к функциям заявлен через Gemini API, Google Workspace и приложение Gemini.
Какие функции получила новая версия
Gemini 3.8 Live обрабатывает изображения почти в реальном времени. Пользователь может показать объект или экран и задать вопрос голосом. Модель также умеет автоматически переходить между 97 поддерживаемыми языками в ходе одного разговора.
Отдельный режим Gemini 3.8 Live Extended Thinking предназначен для задач, где требуется более глубокое рассуждение. Во время обработки он сохраняет голосовой контакт с пользователем, сообщает о ходе работы и может выполнять последовательность действий через инструменты и API. В материалах Google DeepMind приведены примеры с созданием React-компонентов по эскизу, планированием рабочих процессов и оформлением многошаговых бронирований.
| Компонент | Заявленная возможность | Практический сценарий |
|---|---|---|
| Gemini 3.8 Live | Голосовой диалог и визуальный контекст | Обсуждение изображения, схемы или экрана |
| Gemini 3.8 Live Extended Thinking | Рассуждение и фоновые действия | Разбор сложной задачи с последовательным выполнением шагов |
| Gemini API | Подключение голосовых агентов | Создание собственных интерфейсов и учебных прототипов |
Что это даёт для учебных и исследовательских задач
Студент может использовать голосовой режим для первичного разбора схемы, чернового обсуждения структуры курсовой или проверки логики программного прототипа. Исследователям и разработчикам доступны инструменты для создания интерфейсов, которые принимают голосовые команды и сохраняют контекст разговора во время выполнения операций.
При этом ответы модели нельзя автоматически считать готовым академическим результатом. Факты, расчёты, цитаты и программный код потребуется проверять отдельно. Для курсовой работы Gemini 3.8 Live разумно рассматривать как вспомогательный инструмент: он ускоряет обсуждение идеи, но не заменяет чтение первоисточников и самостоятельную проверку выводов.
Какие ограничения указаны в релизе
Показатели 82,6 на Speech to Speech Quality Index, 68,6% на τ-Voice и 97,7% на Big Bench Audio Google приводит как результаты собственных сравнений новой модели. Эти цифры зависят от выбранных тестов и условий оценки, поэтому они не подтверждают одинаковое качество во всех учебных сценариях.
Google DeepMind также сообщила, что аудио, созданное продуктами компании, получает незаметную водяную маркировку SynthID. Перед использованием сервиса стоит проверить доступность нужной функции, ограничения конкретного тарифа и правила обработки данных в выбранном интерфейсе.