Обучение глубоких моделей Transformer для машинного перевода
Learning Deep Transformer Models for Machine Translation
2019-01-01
SCID: 54.1/cs4fhnyv
Discuss with AI
Transformer-Bigглубокий Transformerкомбинация слоёвнормализация слоёвмашинный перевод
Figures from the paper
Abstract (AI)
Transformer является моделью, задающей современный уровень в недавних оценках систем машинного перевода. Существует два перспективных направления исследований по улучшению подобных моделей: первое использует широкие сети (так называемый Transformer-Big) и стало де-факто стандартом в разработке систем Transformer, а второе использует более глубокие представления языка, но сталкивается с трудностями при обучении глубоких сетей. В настоящей работе мы продолжаем исследование второго направления. Мы утверждаем, что по-настоящему глубокая модель Transformer может превзойти эквивалент Transformer-Big благодаря (1) правильному использованию нормализации слоёв (layer normalization) и (2) новому способу передачи комбинации предыдущих слоёв следующему слою. На задачах WMT’16 English–German и NIST OpenMT’12 Chinese–English наша глубокая система (энкодер на 30/25 слоях) превосходит неглубокую базовую и Transformer-Big базу (энкодер на 6 слоях) на 0.4–2.4 BLEU. В качестве дополнительного преимущества глубокая модель в 1.6 раза меньше по размеру и в 3 раза быстрее обучается, чем Transformer-Big.
Key Findings
1
Истинно глубокий Transformer превосходит Transformer-Big при правильном применении нормализации слоёв и новом способе передачи комбинации предыдущих слоёв далее.
2
На наборах WMT’16 English-German и NIST OpenMT’12 Chinese-English глубокая система с энкодером 30/25 слоёв превосходит 6-слойный Transformer-Big/Base на 0.4–2.4 BLEU.
3
Предлагаемая глубокая модель в 1.6× меньше по размеру, чем Transformer-Big.
4
Предлагаемая глубокая модель обучается примерно в 3× быстрее, чем Transformer-Big.
Research Object
Глубокая трансформерная модель для машинного перевода (кодер-декодер с глубоким трансформером)
Research Subject
Методы обучения и архитектурные изменения, обеспечивающие эффективность очень глубоких сетей Transformer (например, использование layer normalization и новый способ передачи/комбинации предыдущих слоёв) и их влияние на качество перевода, размер модели и скорость обучения по сравнению с Transformer-Big/Base
Publication Details
Publication Date
2019-01-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest