источники Google

SpaceXAI выпустила модель распознавания речи Grok Voice Transcribe 2.0, которая, по заявлению разработчиков, вдвое точнее предыдущей версии при сохранении прежней стоимости. Новинка ориентирована на сложные сценарии: телефонные звонки с помехами, одновременную речь нескольких собеседников, а также региональные акценты и диалекты.
В публичном рейтинге Artificial Analysis Grok Voice Transcribe 2.0 заняла первое место среди 32 потоковых моделей по метрике AA-WER Streaming. Согласно данным SpaceXAI, модель демонстрирует 2,7% ошибок (WER) для финальной транскрипции и 3,4% — для промежуточных результатов, выдавая их через 0,49 секунды после окончания речи.
Компания также протестировала новинку на четырёх внутренних наборах данных: телефонные разговоры службы поддержки, диалоги с голосовым ассистентом Grok, произнесённые номера телефонов, адреса электронной почты и обычные адреса, а также короткие фразы для голосовых ассистентов на 19 языках. Во всех четырёх случаях версия 2.0 превзошла предшественницу. На наборе коротких фраз показатель WER снизился с 20,6% до 6,8%, то есть примерно на 67%. При этом внутренние данные предоставлены самой SpaceXAI и независимо не верифицировались.
Одним из ключевых улучшений разработчики называют многоязычное распознавание. Модель автоматически определяет язык, поддерживает десятки языков и способна продолжать расшифровку при переключении языка прямо во время разговора. Документация также указывает на поддержку автоматического форматирования чисел, денежных сумм и единиц измерения для 25 языков.
Модель доступна через Speech to Text API в двух режимах: пакетном и потоковом. В пакетном режиме можно загружать файлы до 500 Мбайт в 12 аудиоформатах. Потоковое распознавание осуществляется через WebSocket с поддержкой аудиокодека Opus при потоке около 4 Кбайт/с (для сравнения: несжатый PCM 24 кГц требует ~48 Кбайт/с). API предоставляет временные метки и оценки уверенности для каждого слова, разделение речи разных собеседников (диаризацию) без дополнительной платы, поддержку до восьми аудиоканалов, возможность задать до 100 ключевых терминов для улучшения распознавания, автоматическое удаление слов-паразитов и определение момента окончания реплики для голосовых ассистентов. В API модель имеет идентификатор grok-voice-transcribe-2.0.
Ценообразование осталось прежним: пакетная расшифровка стоит $0,10 за час аудио, потоковая — $0,20 за час. Grok Voice Transcribe 2.0 уже доступна в облачном API SpaceXAI; в ближайшее время она станет вариантом по умолчанию, а версия 1.0 будет выведена из эксплуатации.






Горячие темы