Transformer-XL: внимательные языковые модели за пределами контекста фиксированной длины
Transformer-XL: Attentive Language Models beyond a Fixed-Length Context
2019-01-01
SCID: 54.1/4hsyvnq2
Discuss with AI
Transformer-XLфрагментация контекстадолговременная зависимостьновая позиционная кодировкарекуррентность на уровне сегмента
Figures from the paper
Abstract (AI)
Трансформеры обладают потенциалом для обучения долгосрочных зависимостей, но в задаче языкового моделирования ограничены контекстом фиксированной длины. Мы предлагаем новую нейронную архитектуру Transformer-XL, которая позволяет обучать зависимости за пределами фиксированной длины без нарушения временной когерентности. Она состоит из механизма рекуррентности на уровне сегментов и новой схемы позиционного кодирования. Наш метод не только позволяет улавливать долгосрочные зависимости, но и решает проблему фрагментации контекста. В результате Transformer-XL обучает зависимости на 80% длиннее, чем РНС, и на 450% длиннее, чем обычные (vanilla) трансформеры, показывает лучшую производительность как на коротких, так и на длинных последовательностях и при оценке работает в более чем 1 800 раз быстрее, чем обычные трансформеры. В частности, мы улучшаем достижения по bits-per-character/перплексии до 0.99 на en-wiki8, 1.08 на text8, 18.3 на WikiText-103, 21.8 на One Billion Word и 54.5 на Penn Treebank (без дообучения). При обучении только на WikiText-103 Transformer-XL способен генерировать достаточно когерентные, новые текстовые статьи длиной в тысячи токенов. Наш код, предварительно обученные модели и гиперпараметры доступны как для TensorFlow, так и для PyTorch.
Key Findings
1
Transformer-XL демонстрирует значительно лучшие результаты на коротких и длинных последовательностях и при оценке работает до более чем в 1 800 раз быстрее, чем стандартные Transformers
2
Transformer-XL вводит механизм рекуррентности на уровне сегментов и новую позиционную кодировку, позволяющие обучать модель за пределами фиксированной длины контекста без нарушения временной согласованности
3
Transformer-XL устраняет проблему фрагментации контекста и захватывает долгосрочные зависимости на 80% дольше по сравнению с RNN и на 450% дольше по сравнению со стандартными Transformers
4
Transformer-XL устанавливает новые передовые результаты (bpc/perplexity): 0.99 на en-wiki8, 1.08 на text8, 18.3 на WikiText-103, 21.8 на One Billion Word и 54.5 на Penn Treebank (без дообучения)
5
При обучении только на WikiText-103 Transformer-XL способен генерировать относительно связные, новые текстовые статьи длиной в тысячи токенов
Research Object
Нейронная языковая модель Transformer-XL (архитектура с рекуррентностью на уровне сегментов и новой схемой позиционного кодирования)
Research Subject
Способность изучать и моделировать долгосрочные зависимости за пределами фиксированной длины контекста, устранение фрагментации контекста и связанные показатели эффективности (длина усвоенных зависимостей, bpc/perplexity, когерентность генерируемого текста и скорость оценки) по сравнению с RNN и обычными трансформерами
Publication Details
Publication Date
2019-01-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai2
Работы, цитирующие эту статью4
Informer: эффективный трансформер для прогнозирования временных рядов большой длины и дальнейшее развитие этого подхода2021
GENA-LM: семейство открытых фундаментальных языковых моделей ДНК для длинных последовательностей2024
Transformers: современное состояние обработки естественного языка2020
ETC: Кодирование длинных и структурированных входных данных в трансформерах2020