?
Сервисы автоматического распознавания речи на русском языке: исследование качества и инклюзивности на примере датасета RuAphasiaBank
Технологии автоматического распознавания речи (АРР) к настоящему моменту стали базовым компонентом бэкенд-инфраструктуры различных голосовых и когнитивных ассистентов, обеспечивая доступ пользователей к коммерческим сервисам и государственным платформам. Однако из-за неравномерного распределения дан-
ных, на которых модели АРР обучаются, острой становится проблема предвзятости моделей при работе с атипичной речью. Цель исследования заключается в оценке качества распознавания и сравнении уровня инклюзивности моделей АРР, доступных сегодня на российском рынке, при обработке речи пациентов с афазией. Материалом для тестирования стал новый датасет RuAphasiaBank с фонограммами русскоговорящих пациентов с афазией и нейротипичных людей. В датасете представлены записи пациентов с разными типами афазий трех степеней тяжести речевого расстройства, а также образцы разных видов речевой деятельности: диалоги, монологи, пересказы и чтение вслух. Для оценки систем АРР использовались транскрипции 44 записей пациентов c легкой и умеренной комплексной моторной афазией и 24 записей нейротипичных информантов. Сравнению подверглись значения стандартных метрик WER и CER у демоверсий четырех коммерческих АРР, поддерживающих русский язык (Yandex SpeechKit, SaluteSpeech, Shopot, T-bank). Все модели показали наибольшее количество ошибок при распознавании записей чтения и пересказа. Монологи были распознаны лучше всего: Yandex SpeechKit показал наилучшую точность (медианный WER 16–55 %), SaluteSpeech – худшую (34–72 %). Наибольшую стабильность при распознавании спонтанной речи в контрольной группе продемонстрировала модель T-Bank (WER 28–38 %). Обнаруженный высокий WER при низком CER указывает на лексический характер ошибок распознавания. Качество распознавания нейротипичной и афазической речи оказалось сопоставимым – модели в целом не справляются с обработкой естественной разговорной речи. Для атипической речи не удалось определить явного лидера, а общий уровень инклюзивности систем АРР на российском рынке оценивается как низкий.