Longformer: трансформер для длинных документов

Longformer: The Long-Document Transformer
Matthew E. Peters, Iz Beltagy, Arman Cohan
2020-04-10

LongformerLongformer-Encoder-Decoder (LED)TriviaQAWikiHopсуммаризация arXivязыковое моделирование на уровне символовenwik8глобальное вниманиелинейно масштабируемое вниманиелокальное оконное вниманиетрансформер для длинных документовпредобучение и дообучениеtext8
Модели на основе трансформеров не в состоянии обрабатывать длинные последовательности из-за операции самовнимания, масштабируемость которой по сложности составляет квадратичную зависимость от длины последовательности. Для преодоления этого ограничения мы представляем Longformer с механизмом внимания, масштабируемость которого линейно зависит от длины последовательности, что позволяет легко обрабатывать документы величиной в тысячи токенов и более. Механизм внимания Longformer является взаимозаменяемой заменой стандартного самовнимания и сочетает локальное оконное внимание с мотивацией для задачи глобальным вниманием. Следуя предыдущим работам по трансформерам для длинных последовательностей, мы оцениваем Longformer на моделировании языка на уровне символов и достигаем передовых результатов на наборах text8 и enwik8. В отличие от большинства предыдущих работ, мы также предварительно обучаем Longformer и дообучаем его на различных прикладных задачах. Наш предварительно обученный Longformer стабильно превосходит RoBERTa в задачах с длинными документами и устанавливает новые передовые результаты на WikiHop и TriviaQA. Наконец, мы представляем Longformer-Encoder-Decoder (LED), вариант Longformer для генеративных задач sequence-to-sequence с длинными документами, и демонстрируем его эффективность на датасете суммаризации arXiv.
1
Предобученный Longformer при дообучении стабильно превосходит RoBERTa на задачах с длинными документами.
2
Longformer вводит механизм внимания, который масштабируется линейно по длине последовательности, позволяя обрабатывать документы длиной в тысячи токенов.
3
Longformer устанавливает новые лучшие результаты на бенчмарках QA WikiHop и TriviaQA.
4
Внимание Longformer является заменой «drop-in», комбинирующей локальное оконное внимание с глобальным вниманием, мотивированным задачей.
5
В задаче моделирования языка на уровне символов Longformer достигает результатов state-of-the-art на наборах text8 и enwik8.
6
В статье представлен Longformer-Encoder-Decoder (LED) для генерации последовательностей с длинными документами и показана его эффективность на датасете суммаризации arXiv.

Модель Longformer (вариант Transformer с механизмом внимания с линейной масштабируемостью для длинных документов)

Механизм внимания и производительность модели при обработке длинных последовательностей, включая комбинированное локальное оконное и целевое глобальное внимание, обеспечивающее линейную масштабируемость и улучшение результатов на задачах с длинными документами (предобучение, дообучение, вопросы-ответы, суммаризация)

Publication Details
Publication Date
2020-04-10
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Matthew E. Peters
Iz Beltagy
Arman Cohan
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%