Развязанная передача знаний (Decoupled Knowledge Distillation)

Decoupled Knowledge Distillation
Quan Cui, Borui Zhao, Renjie Song, Yiyu Qiu, Jiajun Liang
2022-06-01

CIFAR-100Decoupled Knowledge DistillationImageNetMS-COCOклассификация изображенийлогит-дистилляцияdistillation знаний нецелевых классов (NCKD)обнаружение объектовdistillation знаний целевого класса (TCKD)
Современные методы дистилляции в основном основаны на дистилляции глубоких признаков из промежуточных слоев, тогда как значение дистилляции логитов во многом упускается из виду. Чтобы предложить новый взгляд на изучение дистилляции логитов, мы переработали классическую функцию потерь knowledge distillation (KD) на две части: дистилляция знаний по целевому классу (TCKD) и дистилляция знаний по нецелевым классам (NCKD). Мы эмпирически исследуем и показываем эффекты этих двух частей: TCKD передаёт знания, касающиеся «сложности» обучающих примеров, тогда как NCKD является основной причиной эффективности дистилляции логитов. Более того, мы выявляем, что классическая KD-функция потерь является связанной (coupled) формулой, которая (1) подавляет эффективность NCKD и (2) ограничивает гибкость в балансировке этих двух частей. Для решения этих проблем мы предлагаем Развязанную передачу знаний (Decoupled Knowledge Distillation, DKD), позволяющую TCKD и NCKD эффективно и гибко выполнять свои функции. По сравнению со сложными методами на основе признаков, наш DKD даёт сопоставимые или лучшие результаты и обеспечивает лучшую эффективность обучения на наборах данных CIFAR-100, ImageNet и MS-COCO для задач классификации изображений и детекции объектов. В работе демонстрируется большой потенциал дистилляции логитов, и мы надеемся, что это будет полезно для дальнейших исследований. Код доступен по адресу https://github.com/megviiresearch/mdistiller.
1
Классическая функция потерь для distillation (KD) может быть переработана на две части: distillation целевого класса (TCKD) и distillation неклаcсов-мишеней (NCKD).
2
DKD обеспечивает сопоставимые или лучшие результаты по сравнению со сложными методами на основе фич и имеет лучшую эффективность обучения на CIFAR-100, ImageNet и MS-COCO для классификации и детекции объектов.
3
Decoupled Knowledge Distillation (DKD) разъединяет TCKD и NCKD, позволяя каждой части работать более эффективно и гибко.
4
TCKD передаёт знания о «сложности» обучающих образцов, тогда как NCKD является основной причиной эффективности логит-дистилляции.
5
Классическая KD — связанная (coupled) формулировка, которая подавляет эффективность NCKD и ограничивает гибкость балансировки TCKD и NCKD.

Процесс дистилляции знаний на уровне логитов между нейронными сетями-учителем и учеником

Разделение классической функции потерь KD на дистилляцию знаний целевого класса (TCKD) и дистилляцию знаний нецелевых классов (NCKD), анализ их различных ролей и предложение метода Decoupled Knowledge Distillation (DKD) для повышения эффективности и гибкости дистилляции на уровне логитов

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
955
Access Type
Author Information
Authors
Quan Cui
Borui Zhao
Renjie Song
Yiyu Qiu
Jiajun Liang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%