Расовые различия в автоматическом распознавании речи
Racial disparities in automated speech recognition
2020-03-23
SCID: 54.1/s2cecth2
Discuss with AI
афроамериканский вариант английского языкаакустические моделиавтоматическое распознавание речирасовые различиякоэффициент ошибок в словах
Figures from the paper
Abstract (AI)
Системы автоматического распознавания речи (ASR), использующие сложные алгоритмы машинного обучения для преобразования устной речи в текст, получили широкое распространение: они обеспечивают работу популярных виртуальных ассистентов, облегчают автоматическое создание субтитров и поддерживают платформы цифровой диктовки в здравоохранении. За последние несколько лет качество этих систем значительно улучшилось благодаря как достижениям в области глубокого обучения, так и сбору крупномасштабных наборов данных, используемых для обучения систем. Однако существует опасение, что эти инструменты работают недостаточно эффективно для всех подгрупп населения. В данной работе мы исследуем способность пяти современных систем автоматического распознавания речи, разработанных компаниями Amazon, Apple, Google, IBM и Microsoft, транскрибировать структурированные интервью с участием 42 белых и 73 чернокожих говорящих. В общей сложности этот корпус охватывает пять городов США и включает 19,8 ч аудиозаписей, сопоставленных по возрасту и полу говорящих. Мы обнаружили, что все пять систем автоматического распознавания речи демонстрировали существенные расовые различия: средний показатель частоты ошибок в словах (WER) составлял 0,35 для чернокожих говорящих по сравнению с 0,19 для белых. Мы связываем эти различия с используемыми системами базовыми акустическими моделями, поскольку разрыв между расовыми группами был столь же велик для поднабора идентичных фраз, произнесённых чернокожими и белыми участниками нашего корпуса. В заключение мы предлагаем стратегии, такие как использование более разнообразных обучающих наборов данных, включающих афроамериканский вариант английского языка, для сокращения этих различий в производительности и обеспечения инклюзивности технологий распознавания речи.
Key Findings
1
Все пять систем продемонстрировали значительные расовые различия: средний показатель ошибок распознавания слов составил 0,35 для чернокожих говорящих против 0,19 для белых.
2
Пять современных систем автоматического распознавания речи от Amazon, Apple, Google, IBM и Microsoft оценивались на 19,8 часах интервью со 115 участниками из пяти городов США.
3
Для уменьшения расовых различий авторы рекомендуют использовать более разнообразные обучающие наборы данных, включающие афроамериканский вариант английского языка.
4
Разрыв сохранялся при распознавании одинаковых фраз, произнесённых чернокожими и белыми участниками, что указывает на роль акустических моделей систем.
Research Object
Пять современных систем автоматического распознавания речи (ASR), транскрибирующих структурированные интервью с участием чернокожих и белых носителей речи из США
Research Subject
Расовые различия в качестве транскрипции ASR, измеряемые показателями частоты ошибок в словах и связанные с акустическими моделями систем
Publication Details
Publication Date
2020-03-23
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest