Развязанная передача знаний (Decoupled Knowledge Distillation)
Decoupled Knowledge Distillation
2022-06-01
SCID: 54.1/vu8bsajp
Discuss with AI
CIFAR-100Decoupled Knowledge DistillationImageNetMS-COCOклассификация изображенийлогит-дистилляцияdistillation знаний нецелевых классов (NCKD)обнаружение объектовdistillation знаний целевого класса (TCKD)
Figures from the paper
Abstract (AI)
Современные методы дистилляции в основном основаны на дистилляции глубоких признаков из промежуточных слоев, тогда как значение дистилляции логитов во многом упускается из виду. Чтобы предложить новый взгляд на изучение дистилляции логитов, мы переработали классическую функцию потерь knowledge distillation (KD) на две части: дистилляция знаний по целевому классу (TCKD) и дистилляция знаний по нецелевым классам (NCKD). Мы эмпирически исследуем и показываем эффекты этих двух частей: TCKD передаёт знания, касающиеся «сложности» обучающих примеров, тогда как NCKD является основной причиной эффективности дистилляции логитов. Более того, мы выявляем, что классическая KD-функция потерь является связанной (coupled) формулой, которая (1) подавляет эффективность NCKD и (2) ограничивает гибкость в балансировке этих двух частей. Для решения этих проблем мы предлагаем Развязанную передачу знаний (Decoupled Knowledge Distillation, DKD), позволяющую TCKD и NCKD эффективно и гибко выполнять свои функции. По сравнению со сложными методами на основе признаков, наш DKD даёт сопоставимые или лучшие результаты и обеспечивает лучшую эффективность обучения на наборах данных CIFAR-100, ImageNet и MS-COCO для задач классификации изображений и детекции объектов. В работе демонстрируется большой потенциал дистилляции логитов, и мы надеемся, что это будет полезно для дальнейших исследований. Код доступен по адресу https://github.com/megviiresearch/mdistiller.
Key Findings
1
Классическая функция потерь для distillation (KD) может быть переработана на две части: distillation целевого класса (TCKD) и distillation неклаcсов-мишеней (NCKD).
2
DKD обеспечивает сопоставимые или лучшие результаты по сравнению со сложными методами на основе фич и имеет лучшую эффективность обучения на CIFAR-100, ImageNet и MS-COCO для классификации и детекции объектов.
3
Decoupled Knowledge Distillation (DKD) разъединяет TCKD и NCKD, позволяя каждой части работать более эффективно и гибко.
4
TCKD передаёт знания о «сложности» обучающих образцов, тогда как NCKD является основной причиной эффективности логит-дистилляции.
5
Классическая KD — связанная (coupled) формулировка, которая подавляет эффективность NCKD и ограничивает гибкость балансировки TCKD и NCKD.
Research Object
Процесс дистилляции знаний на уровне логитов между нейронными сетями-учителем и учеником
Research Subject
Разделение классической функции потерь KD на дистилляцию знаний целевого класса (TCKD) и дистилляцию знаний нецелевых классов (NCKD), анализ их различных ролей и предложение метода Decoupled Knowledge Distillation (DKD) для повышения эффективности и гибкости дистилляции на уровне логитов
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
955
Access Type
Author Information
Download PDF
Subscribe to digest