Расширенные datasheet'ы для речевых наборов данных и этического принятия решений

Augmented Datasheets for Speech Datasets and Ethical Decision-Making
Orestis Papakyriakopoulos, Anna Seo Gyeong Choi, William Thong, Dora Zhao, Jerone T. A. Andrews, R. D. Bourke, Alice Xiang, Allison Koenecke
2023-06-12

дополненная таблица данных для речевых наборов данныхзащита субъектов данныхэтическое принятие решенийдокументация речевых данныхречевые наборы данных
Речевые наборы данных имеют решающее значение для обучения технологий обработки речи (Speech Language Technologies, SLT); однако отсутствие разнообразия в исходных тренировочных данных может привести к значительным ограничениям при создании справедливых и устойчивых SLT-продуктов, особенно по таким параметрам, как язык, акцент, диалект, вариант и нарушение речи — а также по взаимодействию речевых характеристик с социально-экономическими и демографическими признаками. Более того, зачастую отсутствует надзор за исходными тренировочными данными, которые обычно формируются с помощью масштабного краулинга веба и/или на основе общедоступной речи, в отношении этичности такого сбора данных. С целью поощрения стандартизированной документации компонентов таких речевых данных мы предлагаем расширенный datasheet для речевых наборов данных, который может использоваться дополнительно к «Datasheets for Datasets». Далее мы иллюстрируем важность каждого вопроса в нашем расширенном datasheet на основе углублённых обзоров литературы по речевым данным, используемым в областях машинного обучения, лингвистики и здравоохранения. Наконец, мы призываем практиков — от создателей наборов данных до исследователей — использовать наш расширенный datasheet для более чёткой формулировки объёма, свойств и ограничений речевых наборов данных, а также для учёта защиты субъектов данных и расширения возможностей пользовательских сообществ. Этичное создание наборов данных не является универсальным процессом, но создатели наборов данных могут использовать наш расширенный datasheet для рефлексивного учёта социального контекста соответствующих приложений SLT и источников данных с целью формирования более инклюзивных SLT-продуктов в дальнейшем.
1
Этический надзор часто отсутствует для обучающих данных речи, особенно когда они получены масштабным веб-краулингом или из публичных аудиокорпусов.
2
Практикам рекомендуется использовать расширенную таблицу данных для определения объёма набора данных, его свойств и ограничений, а также для учёта защиты субъектов данных и расширения прав сообществ ради более инклюзивных SLT.
3
Наборы данных речи часто не отличаются разнообразием по языку, акценту, диалекту, разновидности и нарушению речи, что ухудшает справедливость и надежность SLT-продуктов.
4
Расширенная таблица обоснована и проиллюстрирована глубокой проверкой литературы в областях машинного обучения, лингвистики и здравоохранения, чтобы показать важность каждого вопроса.
5
Авторы предлагают расширенную таблицу данных (augmented datasheet) для наборов данных речи в дополнение к «Datasheets for Datasets» для стандартизации документации компонентов речи.

Наборы речевых данных, используемые для обучения технологий обработки речи (SLT)

Документация и этическое принятие решений относительно охвата набора данных, его состава и разнообразия (язык, акцент, диалект, речевые нарушения), практик сбора, защиты субъектов данных и ограничений с помощью дополненной «datasheet» с целью продвижения инклюзивных и ответственных SLT

Publication Details
Publication Date
2023-06-12
Journal
Publisher
ISSN
Cited by
26
Access Type
Author Information
Authors
Orestis Papakyriakopoulos
Anna Seo Gyeong Choi
William Thong
Dora Zhao
Jerone T. A. Andrews
R. D. Bourke
Alice Xiang
Allison Koenecke
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%