Аугментация текстовых данных для глубокого обучения

Text Data Augmentation for Deep Learning
Connor Shorten, Taghi M. Khoshgoftaar, Borko Furht
2021-07-19

согласующая регуляризацияконтрфактические примерытестирование обобщающей способностиобработка естественного языкааугментация текстовых данных
Обработка естественного языка (Natural Language Processing, NLP) является одним из наиболее впечатляющих применений глубокого обучения. В этом обзоре рассматривается, каким образом стратегия обучения с аугментацией данных может способствовать развитию данной области. Сначала мы выделяем основные направления аугментации данных, сводя их к усилению локальных границ принятия решений, обучению методом грубой силы, причинности и контрфактическим примерам, а также различению смысла и формы. Затем в соответствии с этими направлениями приводится конкретный перечень фреймворков аугментации, разработанных для текстовых данных. Глубокое обучение в целом испытывает трудности с измерением способности к обобщению и характеристикой переобучения. Мы рассматриваем исследования, посвящённые тому, как методы аугментации могут использоваться для формирования тестовых наборов для оценки обобщения. По сравнению с компьютерным зрением обработка естественного языка находится на раннем этапе применения аугментации данных. Мы выделяем ключевые различия и перспективные идеи, которые ещё предстоит проверить в задачах обработки естественного языка. Для практической реализации мы описываем инструменты, облегчающие применение аугментации данных, включая регуляризацию согласованности, контроллеры, а также конвейеры офлайн- и онлайн-аугментации, чтобы назвать лишь некоторые из них. Наконец, мы обсуждаем интересные направления, связанные с аугментацией данных в обработке естественного языка, такие как аугментация, специфичная для конкретной задачи; использование априорных знаний в самообучении по сравнению с аугментацией данных; пересечения с трансферным и многозадачным обучением; а также идеи для AI-GAs (AI-Generating Algorithms, алгоритмов, генерирующих искусственный интеллект). Мы надеемся, что эта статья будет способствовать дальнейшему интересу к исследованиям в области аугментации текстовых данных.
1
Аугментация данных позволяет создавать тестовые наборы для оценки обобщающей способности, решая проблему трудностей глубокого обучения с измерением обобщения и характеристикой переобучения.
2
Систематизированы конкретные фреймворки аугментации текстовых данных и практические средства их реализации, включая согласующую регуляризацию, контроллеры и офлайн- или онлайн-конвейеры.
3
Применение аугментации данных в NLP менее развито, чем в компьютерном зрении, что оставляет возможности для адаптации перспективных идей и разработки непроверенных методов для NLP.
4
К перспективным направлениям относятся аугментация с учетом задачи, использование априорных знаний в самоконтролируемом обучении, связь с переносом и многозадачным обучением, а также алгоритмы генерации ИИ.
5
В обзоре систематизированы четыре мотива текстовой аугментации данных: усиление локальных границ решений, обучение методом перебора, причинность и контрфактуальные примеры, а также разделение смысла и формы.

текстовые данные в обработке естественного языка (NLP)

принципы, методы и влияние аугментации данных на обучение моделей NLP, их обобщающую способность и переобучение

Publication Details
Publication Date
2021-07-19
Journal
Publisher
ISSN
Cited by
1706
Access Type
Author Information
Authors
Connor Shorten
Taghi M. Khoshgoftaar
Borko Furht
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%