Обучение глубоких моделей Transformer для машинного перевода

Learning Deep Transformer Models for Machine Translation
Qiang Wang, Tong Xiao, Bei Li, Jingbo Zhu, Changliang Li, Derek F. Wong, Lidia S. Chao
2019-01-01

Transformer-Bigглубокий Transformerкомбинация слоёвнормализация слоёвмашинный перевод
Transformer является моделью, задающей современный уровень в недавних оценках систем машинного перевода. Существует два перспективных направления исследований по улучшению подобных моделей: первое использует широкие сети (так называемый Transformer-Big) и стало де-факто стандартом в разработке систем Transformer, а второе использует более глубокие представления языка, но сталкивается с трудностями при обучении глубоких сетей. В настоящей работе мы продолжаем исследование второго направления. Мы утверждаем, что по-настоящему глубокая модель Transformer может превзойти эквивалент Transformer-Big благодаря (1) правильному использованию нормализации слоёв (layer normalization) и (2) новому способу передачи комбинации предыдущих слоёв следующему слою. На задачах WMT’16 English–German и NIST OpenMT’12 Chinese–English наша глубокая система (энкодер на 30/25 слоях) превосходит неглубокую базовую и Transformer-Big базу (энкодер на 6 слоях) на 0.4–2.4 BLEU. В качестве дополнительного преимущества глубокая модель в 1.6 раза меньше по размеру и в 3 раза быстрее обучается, чем Transformer-Big.
1
Истинно глубокий Transformer превосходит Transformer-Big при правильном применении нормализации слоёв и новом способе передачи комбинации предыдущих слоёв далее.
2
На наборах WMT’16 English-German и NIST OpenMT’12 Chinese-English глубокая система с энкодером 30/25 слоёв превосходит 6-слойный Transformer-Big/Base на 0.4–2.4 BLEU.
3
Предлагаемая глубокая модель в 1.6× меньше по размеру, чем Transformer-Big.
4
Предлагаемая глубокая модель обучается примерно в 3× быстрее, чем Transformer-Big.

Глубокая трансформерная модель для машинного перевода (кодер-декодер с глубоким трансформером)

Методы обучения и архитектурные изменения, обеспечивающие эффективность очень глубоких сетей Transformer (например, использование layer normalization и новый способ передачи/комбинации предыдущих слоёв) и их влияние на качество перевода, размер модели и скорость обучения по сравнению с Transformer-Big/Base

Publication Details
Publication Date
2019-01-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Qiang Wang
Tong Xiao
Bei Li
Jingbo Zhu
Changliang Li
Derek F. Wong
Lidia S. Chao
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%