Дистилляция знаний в нейронной сети
Distilling the Knowledge in a Neural Network
2015-03-09
SCID: 54.1/sx9q4xyw
Discuss with AI
MNISTдистилляция ансамблядистилляция знанийсжатие моделейспециализированные модели
Figures from the paper
Abstract (AI)
Очень простой способ улучшить работу практически любого алгоритма машинного обучения — обучить множество различных моделей на одних и тех же данных, а затем усреднить их предсказания. К сожалению, получение предсказаний с помощью целого ансамбля моделей громоздко и может быть слишком вычислительно дорогим для развертывания у большого числа пользователей, особенно если отдельные модели — крупные нейронные сети. Caruana и соавторы показали, что знания ансамбля можно сжать в одну модель, которую гораздо легче развернуть; мы развиваем этот подход далее, используя другую технику сжатия. Мы добиваемся некоторых неожиданных результатов на MNIST и демонстрируем, что можем существенно улучшить акустическую модель широко используемой коммерческой системы, дистиллируя знания ансамбля моделей в одну модель. Мы также вводим новый тип ансамбля, состоящий из одной или нескольких полноценных моделей и множества специализированных моделей, которые обучаются различать тонкочастные классы, в которых полноразмерные модели путаются. В отличие от смеси экспертов, эти специализированные модели можно быстро обучать параллельно.
Key Findings
1
Представлен новый тип ансамбля, сочетающий одну или несколько полных моделей с многочисленными специалистами; специалисты обучаются различать тонкие классы, путаемые полными моделями.
2
Дистилляция дала неожиданные улучшения производительности на MNIST по сравнению с обычным обучением одной модели.
3
Дистилляция ансамбля в одну модель значительно улучшила акустическую модель в коммерческой системе с большой нагрузкой.
4
Ансамбли моделей улучшают качество, но дороги в развёртывании, поскольку предсказания требуют нескольких больших нейронных сетей.
5
Знание ансамбля можно сжать в одну модель с помощью техники дистилляции/сжатия, что облегчает развёртывание.
6
Специалистские модели можно обучать быстро и параллельно, в отличие от традиционной смеси экспертов.
Research Object
Знание, дистиллированное из ансамбля нейронных сетей в одну нейронную сеть (для задач, таких как классификация MNIST и акустическое моделирование)
Research Subject
Эффективность сжатия/дистилляции моделей: перенос предсказательного поведения ансамбля в одну модель для сохранения производительности при снижении вычислительных затрат, включая использование специализированных моделей и оценку на MNIST и коммерческой акустической системе
Publication Details
Publication Date
2015-03-09
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai4
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Глубокие нейронные сети для акустического моделирования в распознавании речи: общее мнение четырёх исследовательских групп2012
Улучшение нейронных сетей путем предотвращения соадаптации детекторов признаков2012
Адаптивные смеси локальных экспертов1991
Работы, цитирующие эту статью20
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Tokens-to-Token ViT: обучение визуальных трансформеров с нуля на ImageNet2021
Беги, не иди: в поисках более высокой FLOPS для более быстрых нейронных сетей2023
Аугментация текстовых данных для глубокого обучения2021
Объяснимый искусственный интеллект (XAI): что нам известно и чего еще необходимо достичь для создания заслуживающего доверия искусственного интеллекта2023
Обзор неопределённости в глубоких нейронных сетях2023
Эффективные трансформеры: обзор2022
Развязанная передача знаний (Decoupled Knowledge Distillation)2022
Соединяя точки в сфере заслуживающего доверия искусственного интеллекта: от принципов ИИ, этики и ключевых требований к ответственным системам ИИ и регулированию2023
Эффективное ускорение вывода моделей глубокого обучения на периферийных устройствах с ограниченными ресурсами: обзор2022
Оценка непрерывных уровней валентности и активации по лицам в натуралистичных условиях2021
VGSG: Сеть с визуально-направленными семантическими группами для поиска людей по тексту2023
ATVITSC: новый метод классификации зашифрованного трафика на основе глубокого обучения2024
Интерпретируемость предсказательных моделей машинного обучения в здравоохранении2020
Конвергенция периферийных вычислений и глубокого обучения: комплексный обзор2020
TinyBERT: дистилляция BERT для задач понимания естественного языка2020
Глубокое обучение для универсального обнаружения объектов: обзор2019
Согласование корреляций для дистилляции знаний2019
Интерпретируемость машинного обучения: обзор методов и метрик2019
Реляционное сгущение знаний2019