Глубокое остаточное обучение для распознавания изображений
Deep Residual Learning for Image Recognition
2016-06-01
SCID: 54.1/pfjygd2z
Discuss with AI
COCO обнаружение объектовILSVRC 2015ImageNetглубокое резидуальное обучениерезидуальные сети
Figures from the paper
Abstract (AI)
Более глубокие нейронные сети сложнее обучать. Мы предлагаем схему остаточного обучения, облегчающую обучение сетей, которые значительно глубже ранее используемых. Мы явно переформулируем слои как изучающие остаточные функции относительно входов слоя, вместо обучения нефункционально связанных функций. Мы приводим исчерпывающие эмпирические доказательства того, что эти остаточные сети легче оптимизировать и что они могут улучшать точность при существенном увеличении глубины. На наборе данных ImageNet мы оценивали остаточные сети глубиной до 152 слоев — в 8 раз глубже, чем сети VGG [40], но при этом обладающие меньшей сложностью. Ансамбль этих остаточных сетей достигает ошибки 3.57% на тестовом наборе ImageNet. Этот результат занял 1-е место в задаче классификации ILSVRC 2015. Мы также приводим анализ на CIFAR-10 с 100 и 1000 слоями. Глубина представлений имеет ключевое значение для многих задач визуального распознавания. Исключительно благодаря нашим чрезвычайно глубоким представлениям мы получили 28% относительное улучшение на датасете обнаружения объектов COCO. Глубокие остаточные сети легли в основу наших работ для соревнований ILSVRC и COCO 2015, где мы также заняли 1-е места в задачах детекции ImageNet, локализации ImageNet, детекции COCO и сегментации COCO.
Key Findings
1
Ансамбль этих residual-сетей достиг ошибки 3.57% на тестовом наборе ImageNet, заняв 1-е место на ILSVRC 2015 в классификации.
2
Deep residual-сети легли в основу решений, занявших 1-е места в ILSVRC и COCO 2015 по задачам детекции ImageNet, локализации ImageNet, детекции COCO и сегментации.
3
Оценены residual-сети глубиной до 152 слоев на ImageNet (в 8 раз глубже, чем VGG) при меньшей вычислительной сложности.
4
Предложена схема residual-обучения, которая перестраивает слои для обучения функций-остатков относительно входа слоя, упрощая обучение очень глубоких сетей.
5
Экспериментально показано, что residual-сети легче оптимизировать и они получают повышение точности при значительном увеличении глубины.
6
Использование крайне глубоких residual-представлений привело к относительному улучшению на 28% в задаче детекции объектов на COCO.
Research Object
Глубокие остаточные нейронные сети (residual nets) для задач распознавания изображений
Research Subject
Влияние формулировки остаточного обучения на оптимизацию обучения, прирост точности при значительном увеличении глубины сети и производительность на наборах ImageNet, CIFAR-10 и COCO для задач распознавания/детекции
Publication Details
Publication Date
2016-06-01
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai7
Обучение нескольких слоев признаков на маленьких изображениях2024
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Очень глубокие сверточные сети для масштабного распознавания изображений2014
Улучшение нейронных сетей путем предотвращения соадаптации детекторов признаков2012
Распознавание образов и нейронные сети1996
Нейронные сети для распознавания образов1995
Нейронные сети для распознавания образов1994
Работы, цитирующие эту статью20
Высокоточное предсказание структуры белков с помощью AlphaFold2021
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Обзор глубокого обучения: концепции, архитектуры сверточных нейронных сетей, проблемы, применения и перспективные направления2021
Появляющиеся свойства самоконтролируемых Vision Transformer2021
Обзор сверточных нейронных сетей: анализ, применения и перспективы2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
TransUNet: трансформеры как мощные энкодеры для сегментации медицинских изображений2021
Переосмысление семантической сегментации с точки зрения sequence-to-sequence на основе трансформеров2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Video Swin Transformer2022
Масштабируемые диффузионные модели на базе трансформеров2023
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
Классификация гиперспектральных изображений — от традиционных методов к глубоким моделям: обзор и перспективы2021
CLIP-ReID: Использование визуально-языковой модели для повторной идентификации изображений без конкретных текстовых меток2023
Спектрально-пространственная трансформерная сеть для классификации гиперспектральных изображений: факторизованная схема поиска архитектуры2021
Оценка непрерывных уровней валентности и активации по лицам в натуралистичных условиях2021
Обнаружение БПЛА в импульсно-доплеровском радиолокаторе на основе глубокого обучения2021
VGSG: Сеть с визуально-направленными семантическими группами для поиска людей по тексту2023
Алгоритмы детекции объектов YOLO и их промышленные приложения: обзор и сравнительный анализ2025
ATVITSC: новый метод классификации зашифрованного трафика на основе глубокого обучения2024