
Meta представила свою первую модель искусственного интеллекта для обработки аудио в реальном времени — Muse Voice Transcribe. Она способна расшифровывать речь более чем 20 говорящих, работать с несколькими языками одновременно и корректно обрабатывать переключение языка внутри одного предложения.
Ключевые возможности Muse Voice Transcribe
-
Распознавание речи в реальном времени. Модель транслирует аудио в текст по мере его поступления, без необходимости постобработки.
-
Разделение говорящих. Система автоматически определяет, кто именно говорит, и поддерживает до 20+ участников в одной сессии.
-
Мультиязычность и код‑свитчинг. Обучена на более чем 70 языках (25 проверены на запуске), умеет распознавать речь при смене языка внутри предложения.
-
Адаптивная задержка. Модель «сама решает, когда слушать»: дольше ждёт при сложных словах и быстрее реагирует на простые, что повышает точность токенов.
-
Работа с «грязным» аудио. Устойчива к неидеальному качеству записи и поддерживает сессии продолжительностью более часа.
По данным Meta, Muse Voice Transcribe занимает первое место в рейтинге Artificial Analysis по потоковому распознаванию речи, опережая модели от Cartesia, ElevenLabs, OpenAI и Google.
Доступ и стоимость
-
Где работает: модель уже интегрирована в приложение Meta AI для macOS и доступна в среде Muse Code.
-
Для разработчиков: доступ через Meta Model API по цене $3 за 1000 минут аудио (около $0,18 в час).
-
Планы интеграции: на момент запуска Meta не сообщала о планах встраивать Muse Voice Transcribe в другие флагманские сервисы компании.
Контекст: аналог от Google
На прошлой неделе Google анонсировала модель Gemini 3.5 Transcribe с похожими возможностями: потоковое распознавание, поддержка 85+ языков и интеграция в Android и Chrome. В отличие от Google, Meta пока не объявила о системной интеграции своей модели в мобильные ОС или браузеры, сосредоточившись на macOS и API для разработчиков.






Горячие темы