Transformer-XL: внимательные языковые модели за пределами контекста фиксированной длины

Transformer-XL: Attentive Language Models beyond a Fixed-Length Context
Quoc V. Le, Yiming Yang, Zihang Dai, Ruslan Salakhutdinov, Zhilin Yang, Jaime Carbonell
2019-01-01

Transformer-XLфрагментация контекстадолговременная зависимостьновая позиционная кодировкарекуррентность на уровне сегмента
Трансформеры обладают потенциалом для обучения долгосрочных зависимостей, но в задаче языкового моделирования ограничены контекстом фиксированной длины. Мы предлагаем новую нейронную архитектуру Transformer-XL, которая позволяет обучать зависимости за пределами фиксированной длины без нарушения временной когерентности. Она состоит из механизма рекуррентности на уровне сегментов и новой схемы позиционного кодирования. Наш метод не только позволяет улавливать долгосрочные зависимости, но и решает проблему фрагментации контекста. В результате Transformer-XL обучает зависимости на 80% длиннее, чем РНС, и на 450% длиннее, чем обычные (vanilla) трансформеры, показывает лучшую производительность как на коротких, так и на длинных последовательностях и при оценке работает в более чем 1 800 раз быстрее, чем обычные трансформеры. В частности, мы улучшаем достижения по bits-per-character/перплексии до 0.99 на en-wiki8, 1.08 на text8, 18.3 на WikiText-103, 21.8 на One Billion Word и 54.5 на Penn Treebank (без дообучения). При обучении только на WikiText-103 Transformer-XL способен генерировать достаточно когерентные, новые текстовые статьи длиной в тысячи токенов. Наш код, предварительно обученные модели и гиперпараметры доступны как для TensorFlow, так и для PyTorch.
1
Transformer-XL демонстрирует значительно лучшие результаты на коротких и длинных последовательностях и при оценке работает до более чем в 1 800 раз быстрее, чем стандартные Transformers
2
Transformer-XL вводит механизм рекуррентности на уровне сегментов и новую позиционную кодировку, позволяющие обучать модель за пределами фиксированной длины контекста без нарушения временной согласованности
3
Transformer-XL устраняет проблему фрагментации контекста и захватывает долгосрочные зависимости на 80% дольше по сравнению с RNN и на 450% дольше по сравнению со стандартными Transformers
4
Transformer-XL устанавливает новые передовые результаты (bpc/perplexity): 0.99 на en-wiki8, 1.08 на text8, 18.3 на WikiText-103, 21.8 на One Billion Word и 54.5 на Penn Treebank (без дообучения)
5
При обучении только на WikiText-103 Transformer-XL способен генерировать относительно связные, новые текстовые статьи длиной в тысячи токенов

Нейронная языковая модель Transformer-XL (архитектура с рекуррентностью на уровне сегментов и новой схемой позиционного кодирования)

Способность изучать и моделировать долгосрочные зависимости за пределами фиксированной длины контекста, устранение фрагментации контекста и связанные показатели эффективности (длина усвоенных зависимостей, bpc/perplexity, когерентность генерируемого текста и скорость оценки) по сравнению с RNN и обычными трансформерами

Publication Details
Publication Date
2019-01-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Quoc V. Le
Yiming Yang
Zihang Dai
Ruslan Salakhutdinov
Zhilin Yang
Jaime Carbonell
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%