Расовые различия в автоматическом распознавании речи

Racial disparities in automated speech recognition
Dan Jurafsky, Joe Nudell, Sharad Goel, Allison Koenecke, Andrew Nam, Emily Lake, Minnie Quartey, Zion Mengesha, Connor Toups, John R. Rickford
2020-03-23

афроамериканский вариант английского языкаакустические моделиавтоматическое распознавание речирасовые различиякоэффициент ошибок в словах
Системы автоматического распознавания речи (ASR), использующие сложные алгоритмы машинного обучения для преобразования устной речи в текст, получили широкое распространение: они обеспечивают работу популярных виртуальных ассистентов, облегчают автоматическое создание субтитров и поддерживают платформы цифровой диктовки в здравоохранении. За последние несколько лет качество этих систем значительно улучшилось благодаря как достижениям в области глубокого обучения, так и сбору крупномасштабных наборов данных, используемых для обучения систем. Однако существует опасение, что эти инструменты работают недостаточно эффективно для всех подгрупп населения. В данной работе мы исследуем способность пяти современных систем автоматического распознавания речи, разработанных компаниями Amazon, Apple, Google, IBM и Microsoft, транскрибировать структурированные интервью с участием 42 белых и 73 чернокожих говорящих. В общей сложности этот корпус охватывает пять городов США и включает 19,8 ч аудиозаписей, сопоставленных по возрасту и полу говорящих. Мы обнаружили, что все пять систем автоматического распознавания речи демонстрировали существенные расовые различия: средний показатель частоты ошибок в словах (WER) составлял 0,35 для чернокожих говорящих по сравнению с 0,19 для белых. Мы связываем эти различия с используемыми системами базовыми акустическими моделями, поскольку разрыв между расовыми группами был столь же велик для поднабора идентичных фраз, произнесённых чернокожими и белыми участниками нашего корпуса. В заключение мы предлагаем стратегии, такие как использование более разнообразных обучающих наборов данных, включающих афроамериканский вариант английского языка, для сокращения этих различий в производительности и обеспечения инклюзивности технологий распознавания речи.
1
Все пять систем продемонстрировали значительные расовые различия: средний показатель ошибок распознавания слов составил 0,35 для чернокожих говорящих против 0,19 для белых.
2
Пять современных систем автоматического распознавания речи от Amazon, Apple, Google, IBM и Microsoft оценивались на 19,8 часах интервью со 115 участниками из пяти городов США.
3
Для уменьшения расовых различий авторы рекомендуют использовать более разнообразные обучающие наборы данных, включающие афроамериканский вариант английского языка.
4
Разрыв сохранялся при распознавании одинаковых фраз, произнесённых чернокожими и белыми участниками, что указывает на роль акустических моделей систем.

Пять современных систем автоматического распознавания речи (ASR), транскрибирующих структурированные интервью с участием чернокожих и белых носителей речи из США

Расовые различия в качестве транскрипции ASR, измеряемые показателями частоты ошибок в словах и связанные с акустическими моделями систем

Publication Details
Publication Date
2020-03-23
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Dan Jurafsky
Joe Nudell
Sharad Goel
Allison Koenecke
Andrew Nam
Emily Lake
Minnie Quartey
Zion Mengesha
Connor Toups
John R. Rickford
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%