источники Google

Google представила две новые модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, которые превращают генерацию голоса из набора готовых пресетов в гибкий инструмент для создания аудио.
Gemini 3.8 Flash TTS ориентирована на креативные задачи и дизайн персонажей. С помощью текстовых запросов можно задать роль, акцент и характеристики голоса для более чем 100 языков и диалектов. В библиотеке доступно более 2000 готовых голосов, включая региональные варианты мексиканского испанского, квебекского французского и шотландского английского.
Отдельно добавлена возможность клонирования голоса по 30-секундной аудиозаписи. Функция предназначена для собственного голоса или голоса, на использование которого получено право. Перед созданием копии система проверяет согласие владельца голоса, а полученное аудио защищается водяным знаком SynthID и метаданными C2PA.
После выбора голоса разработчик может управлять каждой репликой отдельно с помощью текстовых указаний. Модель способна менять темп и характер исполнения, использовать шёпот и другие элементы звуковой подачи, а также добавлять реакции в виде смеха, вздохов и коротких реплик.
Обе модели поддерживают генерацию длинного аудио с сохранением качества, естественного темпа и характеристик голоса на протяжении нескольких часов, а режим двух говорящих позволяет создавать диалоги из одного сценария, сохраняя раздельные голоса и естественную очередность реплик. Gemini 3.8 Flash-Lite TTS при этом рассчитана прежде всего на масштабные проекты, включая дубляж, создание аудиоконтента и голосовых ИИ-агентов.
По данным Google, Gemini 3.8 Flash TTS заняла первое место в бенчмарке Voice Design компании Hume AI с результатом 71,4 балла, а в тесте моделирования акцента получила 60,8 балла. Flash TTS и Flash-Lite TTS также заняли первое и второе места соответственно в метрике Overall Quality Index. В слепых оценках пользователей на Voice Arena модели показали высокие результаты в японском, бразильском португальском, вьетнамском, современном стандартном арабском, мексиканском испанском и хинди.
Новые модели доступны с 23 сентября 2026 года в Google AI Studio, где появился отдельный интерфейс для создания голосовых сценариев. Gemini 3.8 Flash TTS и Flash-Lite TTS также доступны через Gemini API, а их интеграцию анонсировали платформы Agora, LiveKit, Pipecat и Vercel.






Горячие темы