Дистилляция знаний на уровне последовательностей

Sequence-Level Knowledge Distillation
Alexander M. Rush, Yoon Kim
2016-01-01

BLEUустранение поиска по лучамсжатие знанийнейронный машинный переводпоследовательностное сжатие знаний
Нейронный машинный перевод (NMT) представляет собой новую альтернативную формулировку задачи перевода, потенциально более простую по сравнению со статистическими подходами. Однако для достижения конкурентоспособной производительности модели NMT должны быть чрезвычайно большими. В данной работе мы рассматриваем применение методов дистилляции знаний. Мы показываем, что стандартная дистилляция знаний, применяемая к предсказанию на уровне слов, может быть эффективна для NMT, и также вводим две новые версии дистилляции знаний на уровне последовательностей, которые дополнительно улучшают качество и, что несколько неожиданно, по-видимому устраняют необходимость в поиске с пучком (beam search), даже когда применяются к исходной учительской модели. Наш лучший студент работает в десять раз быстрее своего передового учителя с незначительной потерей в качестве. Он также существенно превосходит эталонную модель, обученную без дистилляции знаний: на 4.2/1.7 BLEU при жадной декодировке/поиске с пучком. Применение обрезки весов (weight pruning) поверх дистилляции знаний приводит к студенту с в 13 раз меньшим числом параметров по сравнению с исходной учительской моделью, при снижении качества на 0.4 BLEU.
1
Применение обрезки весов поверх дистиллирования дает модель-студент с в 13 раз меньшим числом параметров, с уменьшением качества всего на 0.4 BLEU.
2
Дистиллирование на уровне последовательностей может устранить необходимость в beam search, даже при применении к исходной модели-учителю.
3
Стандартное знаниевое дистиллирование на уровне слов эффективно для нейронного машинного перевода (NMT).
4
Лучшая студентская модель работает в 10 раз быстрее, чем передовая модель-учитель, с незначительной потерей качества.
5
Дистиллированная модель превосходит базовую модель, обученную без дистиллирования, на 4.2 BLEU при жадной декодировке и на 1.7 BLEU при beam search.
6
Два новых метода дистиллирования на уровне последовательностей дополнительно улучшают производительность NMT по сравнению с дистиллированием на уровне слов.

Модели нейронного машинного перевода (teacher и student модели NMT)

Эффективность методов дистилляции знаний — на уровне слов и два последовательностных варианта — в отношении производительности student-модели, поведения при декодировании (устранение необходимости beam search), скорости, размера и показателей BLEU

Publication Details
Publication Date
2016-01-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Alexander M. Rush
Yoon Kim
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%