Дистилляция знаний на уровне последовательностей
Sequence-Level Knowledge Distillation
2016-01-01
SCID: 54.1/fnnx3nmq
Discuss with AI
BLEUустранение поиска по лучамсжатие знанийнейронный машинный переводпоследовательностное сжатие знаний
Figures from the paper
Abstract (AI)
Нейронный машинный перевод (NMT) представляет собой новую альтернативную формулировку задачи перевода, потенциально более простую по сравнению со статистическими подходами. Однако для достижения конкурентоспособной производительности модели NMT должны быть чрезвычайно большими. В данной работе мы рассматриваем применение методов дистилляции знаний. Мы показываем, что стандартная дистилляция знаний, применяемая к предсказанию на уровне слов, может быть эффективна для NMT, и также вводим две новые версии дистилляции знаний на уровне последовательностей, которые дополнительно улучшают качество и, что несколько неожиданно, по-видимому устраняют необходимость в поиске с пучком (beam search), даже когда применяются к исходной учительской модели. Наш лучший студент работает в десять раз быстрее своего передового учителя с незначительной потерей в качестве. Он также существенно превосходит эталонную модель, обученную без дистилляции знаний: на 4.2/1.7 BLEU при жадной декодировке/поиске с пучком. Применение обрезки весов (weight pruning) поверх дистилляции знаний приводит к студенту с в 13 раз меньшим числом параметров по сравнению с исходной учительской моделью, при снижении качества на 0.4 BLEU.
Key Findings
1
Применение обрезки весов поверх дистиллирования дает модель-студент с в 13 раз меньшим числом параметров, с уменьшением качества всего на 0.4 BLEU.
2
Дистиллирование на уровне последовательностей может устранить необходимость в beam search, даже при применении к исходной модели-учителю.
3
Стандартное знаниевое дистиллирование на уровне слов эффективно для нейронного машинного перевода (NMT).
4
Лучшая студентская модель работает в 10 раз быстрее, чем передовая модель-учитель, с незначительной потерей качества.
5
Дистиллированная модель превосходит базовую модель, обученную без дистиллирования, на 4.2 BLEU при жадной декодировке и на 1.7 BLEU при beam search.
6
Два новых метода дистиллирования на уровне последовательностей дополнительно улучшают производительность NMT по сравнению с дистиллированием на уровне слов.
Research Object
Модели нейронного машинного перевода (teacher и student модели NMT)
Research Subject
Эффективность методов дистилляции знаний — на уровне слов и два последовательностных варианта — в отношении производительности student-модели, поведения при декодировании (устранение необходимости beam search), скорости, размера и показателей BLEU
Publication Details
Publication Date
2016-01-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest