Аугментация текстовых данных для глубокого обучения
Text Data Augmentation for Deep Learning
2021-07-19
SCID: 54.1/cc5thg48
Discuss with AI
согласующая регуляризацияконтрфактические примерытестирование обобщающей способностиобработка естественного языкааугментация текстовых данных
Figures from the paper
Abstract (AI)
Обработка естественного языка (Natural Language Processing, NLP) является одним из наиболее впечатляющих применений глубокого обучения. В этом обзоре рассматривается, каким образом стратегия обучения с аугментацией данных может способствовать развитию данной области. Сначала мы выделяем основные направления аугментации данных, сводя их к усилению локальных границ принятия решений, обучению методом грубой силы, причинности и контрфактическим примерам, а также различению смысла и формы. Затем в соответствии с этими направлениями приводится конкретный перечень фреймворков аугментации, разработанных для текстовых данных. Глубокое обучение в целом испытывает трудности с измерением способности к обобщению и характеристикой переобучения. Мы рассматриваем исследования, посвящённые тому, как методы аугментации могут использоваться для формирования тестовых наборов для оценки обобщения. По сравнению с компьютерным зрением обработка естественного языка находится на раннем этапе применения аугментации данных. Мы выделяем ключевые различия и перспективные идеи, которые ещё предстоит проверить в задачах обработки естественного языка. Для практической реализации мы описываем инструменты, облегчающие применение аугментации данных, включая регуляризацию согласованности, контроллеры, а также конвейеры офлайн- и онлайн-аугментации, чтобы назвать лишь некоторые из них. Наконец, мы обсуждаем интересные направления, связанные с аугментацией данных в обработке естественного языка, такие как аугментация, специфичная для конкретной задачи; использование априорных знаний в самообучении по сравнению с аугментацией данных; пересечения с трансферным и многозадачным обучением; а также идеи для AI-GAs (AI-Generating Algorithms, алгоритмов, генерирующих искусственный интеллект). Мы надеемся, что эта статья будет способствовать дальнейшему интересу к исследованиям в области аугментации текстовых данных.
Key Findings
1
Аугментация данных позволяет создавать тестовые наборы для оценки обобщающей способности, решая проблему трудностей глубокого обучения с измерением обобщения и характеристикой переобучения.
2
Систематизированы конкретные фреймворки аугментации текстовых данных и практические средства их реализации, включая согласующую регуляризацию, контроллеры и офлайн- или онлайн-конвейеры.
3
Применение аугментации данных в NLP менее развито, чем в компьютерном зрении, что оставляет возможности для адаптации перспективных идей и разработки непроверенных методов для NLP.
4
К перспективным направлениям относятся аугментация с учетом задачи, использование априорных знаний в самоконтролируемом обучении, связь с переносом и многозадачным обучением, а также алгоритмы генерации ИИ.
5
В обзоре систематизированы четыре мотива текстовой аугментации данных: усиление локальных границ решений, обучение методом перебора, причинность и контрфактуальные примеры, а также разделение смысла и формы.
Research Object
текстовые данные в обработке естественного языка (NLP)
Research Subject
принципы, методы и влияние аугментации данных на обучение моделей NLP, их обобщающую способность и переобучение
Publication Details
Publication Date
2021-07-19
Journal
Publisher
ISSN
Cited by
1706
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai12
Обзор графов знаний: представление, получение и приложения2021
К стремлению к обучению причинных представлений2021
Дополнение извлечённой информацией снижает галлюцинации в диалогах2021
Достижения и открытые проблемы федеративного обучения2020
Интеллект, компилируемый через аффордансы: наблюдаемое сопоставление когнитивных импедансов для LLM-интегрированных систем без мета-доступа2020
REALM: предварительное обучение языковой модели с дополнением за счет извлечения информации2020
Обзор методов аугментации изображений для глубокого обучения2019
EDA: Простые методы аугментации данных для повышения качества задач классификации текста2019
Обзор трансферного обучения2016
Дистилляция знаний в нейронной сети2015
ImageNet: крупномасштабная иерархическая база изображений2009
WordNet1995
Работы, цитирующие эту статью4
Обзор глубокого обучения: концепции, архитектуры сверточных нейронных сетей, проблемы, применения и перспективные направления2021
Искусственный интеллект и машинное обучение для медицинской визуализации: обзор технологий2021
Обзор 3D-печатных металлических имплантатов в ортопедии: настоящее и перспективы2023
Прозрачность и воспроизводимость в области искусственного интеллекта2020