Longformer: трансформер для длинных документов
Longformer: The Long-Document Transformer
2020-04-10
SCID: 54.1/ppds75bs
Discuss with AI
LongformerLongformer-Encoder-Decoder (LED)TriviaQAWikiHopсуммаризация arXivязыковое моделирование на уровне символовenwik8глобальное вниманиелинейно масштабируемое вниманиелокальное оконное вниманиетрансформер для длинных документовпредобучение и дообучениеtext8
Figures from the paper
Abstract (AI)
Модели на основе трансформеров не в состоянии обрабатывать длинные последовательности из-за операции самовнимания, масштабируемость которой по сложности составляет квадратичную зависимость от длины последовательности. Для преодоления этого ограничения мы представляем Longformer с механизмом внимания, масштабируемость которого линейно зависит от длины последовательности, что позволяет легко обрабатывать документы величиной в тысячи токенов и более. Механизм внимания Longformer является взаимозаменяемой заменой стандартного самовнимания и сочетает локальное оконное внимание с мотивацией для задачи глобальным вниманием. Следуя предыдущим работам по трансформерам для длинных последовательностей, мы оцениваем Longformer на моделировании языка на уровне символов и достигаем передовых результатов на наборах text8 и enwik8. В отличие от большинства предыдущих работ, мы также предварительно обучаем Longformer и дообучаем его на различных прикладных задачах. Наш предварительно обученный Longformer стабильно превосходит RoBERTa в задачах с длинными документами и устанавливает новые передовые результаты на WikiHop и TriviaQA. Наконец, мы представляем Longformer-Encoder-Decoder (LED), вариант Longformer для генеративных задач sequence-to-sequence с длинными документами, и демонстрируем его эффективность на датасете суммаризации arXiv.
Key Findings
1
Предобученный Longformer при дообучении стабильно превосходит RoBERTa на задачах с длинными документами.
2
Longformer вводит механизм внимания, который масштабируется линейно по длине последовательности, позволяя обрабатывать документы длиной в тысячи токенов.
3
Longformer устанавливает новые лучшие результаты на бенчмарках QA WikiHop и TriviaQA.
4
Внимание Longformer является заменой «drop-in», комбинирующей локальное оконное внимание с глобальным вниманием, мотивированным задачей.
5
В задаче моделирования языка на уровне символов Longformer достигает результатов state-of-the-art на наборах text8 и enwik8.
6
В статье представлен Longformer-Encoder-Decoder (LED) для генерации последовательностей с длинными документами и показана его эффективность на датасете суммаризации arXiv.
Research Object
Модель Longformer (вариант Transformer с механизмом внимания с линейной масштабируемостью для длинных документов)
Research Subject
Механизм внимания и производительность модели при обработке длинных последовательностей, включая комбинированное локальное оконное и целевое глобальное внимание, обеспечивающее линейную масштабируемость и улучшение результатов на задачах с длинными документами (предобучение, дообучение, вопросы-ответы, суммаризация)
Publication Details
Publication Date
2020-04-10
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью7
Informer: эффективный трансформер для прогнозирования временных рядов большой длины и дальнейшее развитие этого подхода2021
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
PRIMERA: предобучение с маскированием предложений на основе пирамиды для многодокументного реферирования2022
GENA-LM: семейство открытых фундаментальных языковых моделей ДНК для длинных последовательностей2024
Transformers: современное состояние обработки естественного языка2020
ETC: Кодирование длинных и структурированных входных данных в трансформерах2020
Transformers от HuggingFace: современные методы обработки естественного языка2019