Дистилляция знаний в нейронной сети

Distilling the Knowledge in a Neural Network
Oriol Vinyals, Jay B. Dean, Geoffrey E. Hinton
2015-03-09

MNISTдистилляция ансамблядистилляция знанийсжатие моделейспециализированные модели
Очень простой способ улучшить работу практически любого алгоритма машинного обучения — обучить множество различных моделей на одних и тех же данных, а затем усреднить их предсказания. К сожалению, получение предсказаний с помощью целого ансамбля моделей громоздко и может быть слишком вычислительно дорогим для развертывания у большого числа пользователей, особенно если отдельные модели — крупные нейронные сети. Caruana и соавторы показали, что знания ансамбля можно сжать в одну модель, которую гораздо легче развернуть; мы развиваем этот подход далее, используя другую технику сжатия. Мы добиваемся некоторых неожиданных результатов на MNIST и демонстрируем, что можем существенно улучшить акустическую модель широко используемой коммерческой системы, дистиллируя знания ансамбля моделей в одну модель. Мы также вводим новый тип ансамбля, состоящий из одной или нескольких полноценных моделей и множества специализированных моделей, которые обучаются различать тонкочастные классы, в которых полноразмерные модели путаются. В отличие от смеси экспертов, эти специализированные модели можно быстро обучать параллельно.
1
Представлен новый тип ансамбля, сочетающий одну или несколько полных моделей с многочисленными специалистами; специалисты обучаются различать тонкие классы, путаемые полными моделями.
2
Дистилляция дала неожиданные улучшения производительности на MNIST по сравнению с обычным обучением одной модели.
3
Дистилляция ансамбля в одну модель значительно улучшила акустическую модель в коммерческой системе с большой нагрузкой.
4
Ансамбли моделей улучшают качество, но дороги в развёртывании, поскольку предсказания требуют нескольких больших нейронных сетей.
5
Знание ансамбля можно сжать в одну модель с помощью техники дистилляции/сжатия, что облегчает развёртывание.
6
Специалистские модели можно обучать быстро и параллельно, в отличие от традиционной смеси экспертов.

Знание, дистиллированное из ансамбля нейронных сетей в одну нейронную сеть (для задач, таких как классификация MNIST и акустическое моделирование)

Эффективность сжатия/дистилляции моделей: перенос предсказательного поведения ансамбля в одну модель для сохранения производительности при снижении вычислительных затрат, включая использование специализированных моделей и оценку на MNIST и коммерческой акустической системе

Publication Details
Publication Date
2015-03-09
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Oriol Vinyals
Jay B. Dean
Geoffrey E. Hinton
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%