Google выпустила Gemini 3.8 Live для голосовых ИИ-приложений
Google 15 сентября выпустила для разработчиков голосовые модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Они доступны через Live API в Gemini API и Google AI Studio и предназначены для создания приложений, которые поддерживают разговор, рассуждают и выполняют действия в реальном времени.
Обе модели поддерживают асинхронные вызовы функций: агент может обращаться к API и инструментам в фоне, не прерывая передачу звукового ответа. Google также заявляет о работе с поступающим визуальным контекстом, точном распознавании буквенно-цифровых данных, постепенном объединении звука со структурированными данными и поддержке более 97 языков.
Версия Extended Thinking получила настраиваемый режим рассуждения для сложных многоэтапных задач. По описанию Google, модель способна обрабатывать такую задачу в фоне и одновременно отвечать пользователю либо проговаривать ход работы. Компания также ссылается на первое место модели в рейтинге Speech-to-Speech от Artificial Analysis, однако на странице объявления не приведены подробности тестирования или результаты независимого воспроизведения.
Google оценивает стоимость Gemini 3.8 Live и Extended Thinking в $0,005 за минуту входящего звука и $0,018 за минуту исходящего. В примечании компания поясняет, что расчёт основан на тарифах $3 за 1 млн входных и $12 за 1 млн выходных токенов. Помимо прямого доступа через Live API, заявлены интеграции с Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel и Vision Agents.
В состав аудиолинейки также входит Gemini 3.5 Transcribe, выпущенная месяцем ранее для потокового преобразования речи в текст. По данным Google, средняя доля ошибочно распознанных слов составляет 4,0% в потоковом и 2,6% в непотоковом режиме. Модель охватывает более 85 языков, автоматически обрабатывает переключение между языками и принимает пользовательский словарь объёмом до 1000 терминов.
Режим Smart Transcription формирует структурированный текст, учитывает самокоррекции говорящего и удаляет слова-паразиты. Через Interactions API модель может расшифровывать аудиофайлы длительностью до одного часа, добавляя временные метки и обозначения говорящих. Заявленные показатели ошибок и точности принадлежат Google; страница объявления не раскрывает использованные наборы данных и методику оценки.
Практический контекст: Практически разделение линейки даёт разработчикам два разных строительных блока: Gemini 3.8 Live подходит для двустороннего голосового агента с действиями и контекстом, а Gemini 3.5 Transcribe — для субтитров, аналитики звонков и других задач, где нужен только текст. Асинхронные вызовы функций особенно важны для сценариев с внешними сервисами: они позволяют не останавливать разговор на время выполнения запроса, хотя фактическая задержка будет зависеть и от подключённой инфраструктуры.
| Параметр | Значение |
|---|---|
| Канал доступа | Live API в Gemini API и Google AI Studio |
| Входящий звук | $0,005 за минуту |
| Исходящий звук | $0,018 за минуту |
| Интеграции | Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel, Vision Agents |
Источники
Дата события: 2026-09-15. Дата первоисточника: 2026-09-15.