Представлена ИИ-модель Gemini 3.5 Transcribe для распознавания речи

Google представила Gemini 3.5 Transcribe — модель распознавания речи для точной расшифровки аудиопотоков в реальном времени и обработки предварительно записанных файлов.

В отличие от обычных систем транскрибации, решение очищает расшифровку от пауз и слов-паразитов, расставляет знаки препинания и корректирует текст с учётом контекста. Модель также способна адаптироваться к специализированной терминологии. По данным Google, доля ошибок при обработке готовых аудиозаписей составляет 2,6%, а при распознавании речи в реальном времени — 4,0%. По скорости отклика и точности работы более чем с 85 языками и диалектами Gemini 3.5 Transcribe превосходит предыдущую модель компании Chirp 3 более чем на 85%.

Разработчики могут подключать инструмент через API в Google AI Studio и Gemini Enterprise Agent Platform. Доступны два режима работы: с минимальной задержкой для интерактивных голосовых сервисов и для фоновой обработки записанных аудиофайлов. Во втором случае система способна одновременно распознавать речь до трёх человек.

Технология уже интегрирована в ряд продуктов Google. Среди них — функция голосового ввода в клавиатуре Gboard для Android, система Google Antigravity, приложение Gemini для macOS и браузер Chrome.

В версии для macOS модель поддерживает голосовое управление функциями генерации изображений и анализа файлов непосредственно через курсор. При этом она может передавать выполнение соответствующих задач другим языковым моделям.

Регион: 

Рубрики: 

Заметили ошибку? Выделите ее мышкой и нажмите Ctrl+Enter!