TERA: самообучение представлению, получаемому кодировщиком-трансформером, для речи
TERA: Self-Supervised Learning of Transformer Encoder Representation for Speech
2021-01-01
SCID: 54.1/ahysfshc
Discuss with AI
представления кодировщика Transformerреконструкция акустических кадровклассификация фонемсамоконтролируемое предварительное обучение речиречевые представления
Figures from the paper
Abstract (AI)
Мы представляем метод предварительного обучения речевых моделей с самоконтролем под названием TERA — Transformer Encoder Representations from Alteration (представления кодировщика-трансформера, получаемые из модификаций). В современных подходах обучение часто осуществляется с использованием одной вспомогательной задачи, такой как контрастивное предсказание, авторегрессионное предсказание или реконструкция по маске. В отличие от предыдущих методов, мы применяем модификации по трём ортогональным осям для предварительного обучения кодировщиков-трансформеров на большом объёме неразмеченной речи. Модель обучается посредством реконструкции акустических кадров по их модифицированным версиям; для этого используется стохастическая стратегия изменения различных измерений: времени, частоты и амплитуды. TERA может применяться для извлечения речевых представлений или дообучения совместно с моделями для последующих задач. Мы оцениваем TERA на нескольких последующих задачах, включая классификацию фонем, обнаружение ключевых слов, распознавание диктора и распознавание речи. Мы представляем крупномасштабное сравнение различных моделей с самоконтролем. В этом сравнении TERA демонстрирует высокие результаты, превосходя поверхностные признаки и предыдущие модели. В экспериментах мы изучаем влияние применения различных методов модификации, предварительного обучения на большем объёме данных и предварительного обучения на различных признаках. Мы анализируем модели разных размеров и обнаруживаем, что небольшие модели лучше обучаются представлениям, чем крупные, тогда как крупные модели эффективнее при последующем дообучении. Кроме того, мы показываем, что предложенный метод переносим на наборы данных для последующих задач, которые не использовались при предварительном обучении.
Key Findings
1
Эксперименты исследуют стратегии искажений, объём данных предварительного обучения, типы признаков и размер модели; малые модели лучше учат представления, а крупные эффективнее подходят для последующей тонкой настройки.
2
TERA демонстрирует высокую эффективность в классификации фонем, обнаружении ключевых слов, распознавании говорящего и распознавании речи, превосходя предыдущие модели и поверхностные признаки.
3
TERA представляет метод самосупервизорного предварительного обучения речи, восстанавливающий акустические кадры после стохастических искажений по времени, частоте и амплитуде.
4
TERA эффективно переносится на наборы данных последующих задач, не использовавшиеся при предварительном обучении.
5
Использование трёх ортогональных измерений искажений отличает TERA от методов, основанных на одной вспомогательной задаче, например контрастивном предсказании или маскированной реконструкции.
Research Object
кодировщики Transformer TERA, предварительно обученные на больших объемах неразмеченной речи
Research Subject
самоконтролируемое обучение речевых представлений посредством восстановления акустических кадров, изменённых по осям времени, частоты и амплитуды, а также эффективность их переноса на последующие задачи
Publication Details
Publication Date
2021-01-01
Journal
Publisher
ISSN
Cited by
322
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest