
Google представила Gemini 3.5 Transcribe — модель распознавания речи для точной расшифровки аудиопотоков в реальном времени и обработки предварительно записанных файлов.
В отличие от обычных систем транскрибации, решение очищает расшифровку от пауз и слов-паразитов, расставляет знаки препинания и корректирует текст с учётом контекста. Модель также способна адаптироваться к специализированной терминологии. По данным Google, доля ошибок при обработке готовых аудиозаписей составляет 2,6%, а при распознавании речи в реальном времени — 4,0%. По скорости отклика и точности работы более чем с 85 языками и диалектами Gemini 3.5 Transcribe превосходит предыдущую модель компании Chirp 3 более чем на 85%.
Разработчики могут подключать инструмент через API в Google AI Studio и Gemini Enterprise Agent Platform. Доступны два режима работы: с минимальной задержкой для интерактивных голосовых сервисов и для фоновой обработки записанных аудиофайлов. Во втором случае система способна одновременно распознавать речь до трёх человек.
Технология уже интегрирована в ряд продуктов Google. Среди них — функция голосового ввода в клавиатуре Gboard для Android, система Google Antigravity, приложение Gemini для macOS и браузер Chrome.
В версии для macOS модель поддерживает голосовое управление функциями генерации изображений и анализа файлов непосредственно через курсор. При этом она может передавать выполнение соответствующих задач другим языковым моделям.






Горячие темы