
Исследователи "Яндекса" опубликовали научную статью с подробным описанием нейросетевой технологии, которая позволяет распознавать голосовые команды даже на фоне шума. Это решение уже применяется в устройствах "Яндекса", а теперь его смогут воспроизвести разработчики со всего мира. Статью приняли на крупнейшую международную конференцию по речевым технологиям Interspeech, которая пройдёт в этом году в Нидерландах. На конференции будут представлены также работы Microsoft, Google DeepMind, Google AR и других технологических компаний и научных центров.
Технология, описанная в научной работе, применяется в умных колонках и ТВ Станциях "Яндекса" и доказала свою эффективность. Благодаря ей устройства с Алисой улавливают команды на фоне самых разных шумов: звуков музыки, льющейся воды, вечеринки или стройки за окном. Например, пользователю не нужно выключать пылесос или перекрикивать песню, чтобы быть услышанным. Эта разработка позволит компаниям ускорить создание собственных ассистентов и устройств с голосовым управлением, а также снизить число ложных срабатываний. В свою очередь, пользователи получат продукты с удобным голосовым управлением.
Обычно в умных устройствах и ассистентах используют алгоритмы эхоподавления, которые помогают распознать голос на фоне музыки. Уменьшить другие фоновые звуки помогают алгоритмы шумоподавления, но они ухудшают и человеческую речь. Для решения этой проблемы "Яндекс" разработал нейросетевой attention-механизм, который получает на вход сразу два сигнала — с шумоподавлением и эхоподавлением. В каждый момент времени нейросеть выбирает наиболее чёткий сигнал, что и позволяет распознавать команды на фоне самых разных звуков.





