Агрегированные остаточные преобразования для глубоких нейронных сетей
Aggregated Residual Transformations for Deep Neural Networks
2017-07-01
SCID: 54.1/bmgm3cjm
Discuss with AI
обнаружение объектов COCOклассификация изображений ImageNetResNeXtагрегированные остаточные преобразованиякардинальность
Figures from the paper
Abstract (AI)
Мы представляем простую, высокомодульную архитектуру сети для классификации изображений. Наша сеть строится путем повторения базового блока, который агрегирует набор преобразований с одинаковой топологией. В результате простой конструкции получается однородная многоветвенная архитектура, требующая настройки лишь нескольких гиперпараметров. Этот подход выявляет новое измерение, которое мы называем кардинальностью (размером набора преобразований), как существенный фактор наряду с глубиной и шириной сети. На наборе данных ImageNet-1K мы эмпирически показываем, что даже при ограничении на сохранение вычислительной сложности увеличение кардинальности позволяет повысить точность классификации. Более того, при увеличении емкости сети наращивание кардинальности оказывается эффективнее, чем увеличение глубины или ширины. Наши модели, получившие название ResNeXt, легли в основу нашей заявки на задачу классификации ILSVRC 2016, в которой мы заняли 2-е место. Далее мы исследуем ResNeXt на наборе ImageNet-5K и наборе данных для обнаружения объектов COCO, также демонстрируя лучшие результаты по сравнению с соответствующим вариантом ResNet. Исходный код и модели доступны онлайн.
Key Findings
1
Введена кардинальность — число параллельных преобразований — как отдельное измерение архитектуры наряду с глубиной и шириной сети.
2
Представлена ResNeXt — модульная архитектура, многократно агрегирующая несколько преобразований с одинаковой топологией.
3
На ImageNet-1K увеличение кардинальности повышает точность классификации даже при сохранении вычислительной сложности.
4
ResNeXt заняла второе место в задаче классификации ILSVRC 2016 и превзошла соответствующие модели ResNet на ImageNet-5K и в задаче детектирования COCO.
5
При увеличении ёмкости модели рост кардинальности оказывается эффективнее увеличения глубины или ширины.
Research Object
Архитектура глубокой нейронной сети ResNeXt (многоветвевой агрегирующий остаточный трансформационный блок) для классификации изображений
Research Subject
Влияние мощности множества преобразований (кардинальности), глубины и ширины на точность классификации изображений и емкость модели
Publication Details
Publication Date
2017-07-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai3
Работы, цитирующие эту статью6
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Лёгкий гибридный Mamba2 для неконтролируемой регистрации медицинских изображений2025
Нелокальные нейронные сети2018