Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»
Exploring the Limits of Transfer Learning with a Unified Text-to-Text\n Transformer
2019-10-23
SCID: 54.1/y4yj9rjq
Discuss with AI
Colossal Clean Crawled Corpusцели предварительного обучениясуммаризациятрансформер текст-в-текстпереносное обучение
Figures from the paper
Abstract (AI)
Переносное обучение, при котором модель сначала предварительно обучается на задаче с большим объемом данных, а затем дообучается на целевой задаче, стало мощной техникой в обработке естественного языка (NLP). Эффективность переносного обучения породила разнообразие подходов, методологий и практик. В этой работе мы исследуем ландшафт методов переносного обучения для NLP, представив унифицированную рамку, которая преобразует все текстовые языковые задачи в формат «текст-в-текст». В нашем систематическом исследовании мы сравниваем цели предварительного обучения, архитектуры, наборы немаркированных данных, подходы к переносному обучению и другие факторы на десятках задач понимания языка. Объединив полученные выводы с увеличением масштаба и нашим новым «Colossal Clean Crawled Corpus», мы достигаем передовых результатов на многих бенчмарках, охватывающих суммаризацию, вопросо-ответные задачи, классификацию текста и др. Для облегчения дальнейшей работы по переносному обучению в NLP мы публикуем наш набор данных, предварительно обученные модели и код.
Key Findings
1
Комбинация выводов исследования, масштабирования модели и нового корпуса 'Colossal Clean Crawled Corpus' обеспечивает лучшие в литературе результаты по многим бенчмаркам, включая суммаризацию, ответ на вопросы и классификацию текста.
2
Проведено систематическое сравнение предобучающих задач, архитектур, неразмеченных наборов данных и подходов к переносу на десятках задач понимания языка.
3
Авторы публикуют свой набор данных, предобученные модели и код для облегчения будущих исследований по трансферному обучению в NLP.
4
Унифицированная text-to-text схема преобразует все текстовые языковые задачи в единый формат text-to-text для трансферного обучения.
Research Object
Унифицированная текст-в-текст трансформерная рамка для обработки естественного языка (включая Colossal Clean Crawled Corpus и предобученные модели)
Research Subject
Границы и эффективность переноса обучения в задачах NLP, исследуемые посредством преобразования всех текстовых задач в текст-в-текст формат: сравнение целей предобучения, архитектур, неразмеченных данных, подходов переноса и масштабирования для достижения передовых результатов
Publication Details
Publication Date
2019-10-23
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью20
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pre-train, Prompt, and Predict: Систематический обзор методов использования подсказок в обработке естественного языка2022
ChatGPT: комплексный обзор предпосылок создания, применений, ключевых проблем, предвзятости, этических аспектов, ограничений и перспектив развития2023
Swin Transformer V2: увеличение ёмкости и разрешения2022
Предобученный трансформер для обработки изображений2021
Video Swin Transformer2022
WavLM: крупномасштабное самосупервизорное предварительное обучение для комплексной обработки речи2022
Затерянные в середине: как языковые модели используют длинные контексты2024
Эффективные трансформеры: обзор2022
Обзор безопасности и конфиденциальности больших языковых моделей (LLM): Хорошее, Плохое и Уродливое2024
Большие языковые модели для программной инженерии: систематический обзор литературы2024
Обзор взаимодействия RAG и LLM: к большим языковым моделям с дополнением извлечённой информацией2024
Обзор анализа тональности на основе аспектов: задачи, методы и проблемы2022
Могут ли большие языковые модели преобразовать вычислительную социальную науку?2023
Системы рекомендаций в эпоху больших языковых моделей (LLMs)2024
GPT-NeoX-20B: Открытая авторегрессивная языковая модель2022
Язык белков: обработка естественного языка, машинное обучение и белковые последовательности2021
GQA: обучение обобщённых трансформерных моделей с grouped-query attention на основе чекпоинтов с многоголовым вниманием2023
Обзор анализа сентимента в платформах социальных сетей2023
Раскрытие потенциала инженерии промптов для больших языковых моделей2025