Обучение глубоких моделей Transformer для машинного перевода
Learning Deep Transformer Models for Machine Translation
2019-06-05
SCID: 54.1/zja9xpvm
Discuss with AI
Transformer-Bigглубокий Transformerнормализация слоевмашинный переводагрегация предыдущих слоев
Figures from the paper
Abstract (AI)
Transformer является передовой моделью в недавних оценках систем машинного перевода. Два направления исследований обещают улучшить модели этого класса: первое использует широкие сети (так называемый Transformer-Big) и стало де-факто стандартом при разработке Transformer, второе использует более глубокие представления языка, но сталкивается с трудностями при обучении глубоких сетей. Здесь мы продолжаем исследование второго направления. Мы утверждаем, что по-настоящему глубокая модель Transformer может превзойти аналог Transformer-Big за счёт (1) корректного использования нормализации слоёв и (2) нового способа передачи комбинации предыдущих слоёв на следующий. На задачах WMT'16 English–German, NIST OpenMT'12 Chinese–English и большей WMT'18 Chinese–English наша глубокая система (кодировщик из 30/25 слоёв) превосходит неглубокий базовый/Transformer-Big эталон (кодировщик из 6 слоёв) на 0.4–2.4 BLEU. В качестве дополнительного преимущества глубокая модель в 1.6× меньше по размеру и в 3× быстрее при обучении по сравнению с Transformer-Big.
Key Findings
1
По-настоящему глубокий Transformer с корректной нормализацией слоёв и новым способом передачи комбинации предыдущих слоёв превосходит Transformer-Big.
2
На WMT'16 English-German, NIST OpenMT'12 Chinese-English и WMT'18 Chinese-English глубокая система с энкодером 30/25 слоёв превосходит 6-слойный Transformer-Big/Base на 0.4–2.4 BLEU.
3
Предложенная глубокая модель на 1.6× меньше по размеру параметров, чем Transformer-Big.
4
Предложенная глубокая модель обучается примерно в 3× быстрее, чем Transformer-Big.
Research Object
Глубокие модели Transformer для машинного перевода (архитектуры с энкодером 30/25 слоёв)
Research Subject
Приёмы обучения и архитектурные методы (использование нормализации слоёв и новый способ передачи/комбинирования предыдущих слоёв) для обучения очень глубоких сетей Transformer и их влияние на качество перевода, размер модели и скорость обучения по сравнению с Transformer-Big/Base
Publication Details
Publication Date
2019-06-05
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest