Google представила Gemini 3.8 Flash TTS и Flash-Lite TTS
Google 23 сентября представила модели генерации речи Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS для создателей контента, разработчиков и компаний. Flash предназначена для проектирования персонажей и детальной постановки сцен, а Flash-Lite оптимизирована для экономичной массовой озвучки, создания аудиоконтента и голосовых агентов.
Gemini 3.8 Flash TTS позволяет создавать голос с помощью текстового описания роли, акцента и других характеристик. По данным Google, модель охватывает более 100 языков и диалектов. Компания также предлагает свыше 2000 подготовленных голосов, в том числе варианты мексиканского испанского, квебекского французского и шотландского английского.
Обе модели позволяют управлять подачей отдельных реплик с помощью сценарных указаний. Для Flash TTS Google отдельно заявляет детальную настройку актерских подсказок, темпа, смены диалекта и разговорных реакций; для Flash-Lite — управление тоном, темпом и выразительными нюансами. Модели также поддерживают постановку диалога двух собеседников из одного сценария с разделением голосов и естественным чередованием реплик.
Google утверждает, что при многочасовой генерации сохраняются качество голоса, естественный темп и тембр персонажа с минимальным отклонением голоса, что рассчитано на подкасты и аудиокниги. В сценарии можно добавлять невербальные реакции и короткие реплики активного слушания — например, смех, вздохи или междометия.
Flash TTS может воссоздать голосовой профиль по 30-секундному образцу голоса пользователя или человека, права на использование голоса которого у него есть. Перед созданием профиля требуется устная запись согласия владельца, совпадающая с голосом в образце. Google сообщает, что аудио моделей Gemini Audio маркируется незаметным водяным знаком SynthID; для репликации также предусмотрены учетные данные C2PA.
Развертывание обеих моделей началось в Gemini API и Google AI Studio. Flash TTS также появляется в Gemini Notebook, а Flash-Lite TTS — в Google Vids. Доступ через API Gemini Enterprise обещан позднее. Отдельно Google анонсировала будущую функцию ремикса готовых голосов с настройкой тембра, высоты, темпа и акцента.
Практический контекст: Разделение линейки дает разработчикам выбор между более глубокой режиссурой голосов и масштабной обработкой типовых материалов. При выборе модели важно учитывать, что детальная смена диалекта прямо заявлена для Flash TTS, но не для Flash-Lite. Репликация голосов также требует подтвержденного согласия и имеет территориальные ограничения в AI Studio.
Google сообщает, что Flash TTS получила 71,4 балла в Voice Design Benchmark компании Hume AI и 60,8 балла за моделирование акцентов. По заявлению компании, Flash и Flash-Lite заняли соответственно первое и второе места в Overall Quality Index. Это опубликованные поставщиком результаты; в исходном сообщении нет подробного описания методики для их независимой оценки.
| Модель | Основное назначение | Заявленное развертывание |
|---|---|---|
| Gemini 3.8 Flash TTS | Создание голосов, персонажей и детально поставленных сцен | Gemini API, Google AI Studio и Gemini Notebook; позднее — API Gemini Enterprise |
| Gemini 3.8 Flash-Lite TTS | Массовая озвучка, аудиоконтент и выразительные голосовые агенты | Gemini API, Google AI Studio и Google Vids; позднее — API Gemini Enterprise |
Географические ограничения репликации голоса
Репликация голоса через Google AI Studio недоступна в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии. Для создания профиля требуется устная запись согласия владельца, совпадающая с референсным голосом.
Источники
Дата события: 2026-09-23. Дата первоисточника: 2026-09-23.