Расширенные datasheet'ы для речевых наборов данных и этического принятия решений
Augmented Datasheets for Speech Datasets and Ethical Decision-Making
2023-06-12
SCID: 54.1/ntj88678
Discuss with AI
дополненная таблица данных для речевых наборов данныхзащита субъектов данныхэтическое принятие решенийдокументация речевых данныхречевые наборы данных
Figures from the paper
Abstract (AI)
Речевые наборы данных имеют решающее значение для обучения технологий обработки речи (Speech Language Technologies, SLT); однако отсутствие разнообразия в исходных тренировочных данных может привести к значительным ограничениям при создании справедливых и устойчивых SLT-продуктов, особенно по таким параметрам, как язык, акцент, диалект, вариант и нарушение речи — а также по взаимодействию речевых характеристик с социально-экономическими и демографическими признаками. Более того, зачастую отсутствует надзор за исходными тренировочными данными, которые обычно формируются с помощью масштабного краулинга веба и/или на основе общедоступной речи, в отношении этичности такого сбора данных. С целью поощрения стандартизированной документации компонентов таких речевых данных мы предлагаем расширенный datasheet для речевых наборов данных, который может использоваться дополнительно к «Datasheets for Datasets». Далее мы иллюстрируем важность каждого вопроса в нашем расширенном datasheet на основе углублённых обзоров литературы по речевым данным, используемым в областях машинного обучения, лингвистики и здравоохранения. Наконец, мы призываем практиков — от создателей наборов данных до исследователей — использовать наш расширенный datasheet для более чёткой формулировки объёма, свойств и ограничений речевых наборов данных, а также для учёта защиты субъектов данных и расширения возможностей пользовательских сообществ. Этичное создание наборов данных не является универсальным процессом, но создатели наборов данных могут использовать наш расширенный datasheet для рефлексивного учёта социального контекста соответствующих приложений SLT и источников данных с целью формирования более инклюзивных SLT-продуктов в дальнейшем.
Key Findings
1
Этический надзор часто отсутствует для обучающих данных речи, особенно когда они получены масштабным веб-краулингом или из публичных аудиокорпусов.
2
Практикам рекомендуется использовать расширенную таблицу данных для определения объёма набора данных, его свойств и ограничений, а также для учёта защиты субъектов данных и расширения прав сообществ ради более инклюзивных SLT.
3
Наборы данных речи часто не отличаются разнообразием по языку, акценту, диалекту, разновидности и нарушению речи, что ухудшает справедливость и надежность SLT-продуктов.
4
Расширенная таблица обоснована и проиллюстрирована глубокой проверкой литературы в областях машинного обучения, лингвистики и здравоохранения, чтобы показать важность каждого вопроса.
5
Авторы предлагают расширенную таблицу данных (augmented datasheet) для наборов данных речи в дополнение к «Datasheets for Datasets» для стандартизации документации компонентов речи.
Research Object
Наборы речевых данных, используемые для обучения технологий обработки речи (SLT)
Research Subject
Документация и этическое принятие решений относительно охвата набора данных, его состава и разнообразия (язык, акцент, диалект, речевые нарушения), практик сбора, защиты субъектов данных и ограничений с помощью дополненной «datasheet» с целью продвижения инклюзивных и ответственных SLT
Publication Details
Publication Date
2023-06-12
Journal
Publisher
ISSN
Cited by
26
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai5
Устойчивое распознавание речи с помощью масштабного слабого обучения2022
Алгоритмическая справедливость: выбор, допущения и определения2020
Расовые различия в автоматическом распознавании речи2020
Transformers от HuggingFace: современные методы обработки естественного языка2019
Миф о языковых универсалиях: языковое разнообразие и его значение для когнитивной науки2009