Обучение глубоких моделей Transformer для машинного перевода

Learning Deep Transformer Models for Machine Translation
Jingbo Zhu, Qiang Wang, Tong Xiao, Bei Li, Changliang Li, Derek F. Wong, Lidia S. Chao
2019-06-05

Transformer-Bigглубокий Transformerнормализация слоевмашинный переводагрегация предыдущих слоев
Transformer является передовой моделью в недавних оценках систем машинного перевода. Два направления исследований обещают улучшить модели этого класса: первое использует широкие сети (так называемый Transformer-Big) и стало де-факто стандартом при разработке Transformer, второе использует более глубокие представления языка, но сталкивается с трудностями при обучении глубоких сетей. Здесь мы продолжаем исследование второго направления. Мы утверждаем, что по-настоящему глубокая модель Transformer может превзойти аналог Transformer-Big за счёт (1) корректного использования нормализации слоёв и (2) нового способа передачи комбинации предыдущих слоёв на следующий. На задачах WMT'16 English–German, NIST OpenMT'12 Chinese–English и большей WMT'18 Chinese–English наша глубокая система (кодировщик из 30/25 слоёв) превосходит неглубокий базовый/Transformer-Big эталон (кодировщик из 6 слоёв) на 0.4–2.4 BLEU. В качестве дополнительного преимущества глубокая модель в 1.6× меньше по размеру и в 3× быстрее при обучении по сравнению с Transformer-Big.
1
По-настоящему глубокий Transformer с корректной нормализацией слоёв и новым способом передачи комбинации предыдущих слоёв превосходит Transformer-Big.
2
На WMT'16 English-German, NIST OpenMT'12 Chinese-English и WMT'18 Chinese-English глубокая система с энкодером 30/25 слоёв превосходит 6-слойный Transformer-Big/Base на 0.4–2.4 BLEU.
3
Предложенная глубокая модель на 1.6× меньше по размеру параметров, чем Transformer-Big.
4
Предложенная глубокая модель обучается примерно в 3× быстрее, чем Transformer-Big.

Глубокие модели Transformer для машинного перевода (архитектуры с энкодером 30/25 слоёв)

Приёмы обучения и архитектурные методы (использование нормализации слоёв и новый способ передачи/комбинирования предыдущих слоёв) для обучения очень глубоких сетей Transformer и их влияние на качество перевода, размер модели и скорость обучения по сравнению с Transformer-Big/Base

Publication Details
Publication Date
2019-06-05
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jingbo Zhu
Qiang Wang
Tong Xiao
Bei Li
Changliang Li
Derek F. Wong
Lidia S. Chao
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%