Переосмысление архитектуры Inception для компьютерного зрения
Rethinking the Inception Architecture for Computer Vision
2016-06-01
SCID: 54.1/t323w5yr
Discuss with AI
ILSVRC 2012архитектура Inceptionвычислительная эффективностьсверточные сетифакторизованные свертки
Figures from the paper
Abstract (AI)
Сверточные сети лежат в основе большинства современных решений в области компьютерного зрения для широкого спектра задач. С 2014 года очень глубокие сверточные сети начали становиться стандартом, обеспечивая существенный прирост качества на различных тестах. Хотя увеличение размера модели и вычислительных затрат обычно приводит к немедленному повышению качества для большинства задач при наличии достаточного количества размеченных данных для обучения, вычислительная эффективность и небольшое число параметров по-прежнему являются ключевыми факторами для различных вариантов применения, включая мобильное компьютерное зрение и сценарии обработки больших данных. В данной работе мы исследуем способы масштабирования сетей, направленные на максимально эффективное использование дополнительных вычислений за счет подходящей факторизации сверток и агрессивной регуляризации. Мы оцениваем предложенные методы на валидационном наборе задачи классификации ILSVRC 2012 и демонстрируем существенное превосходство над текущим уровнем техники: 21,2% ошибки top-1 и 5,6% ошибки top-5 при оценке по одному изображению с использованием сети, требующей 5 миллиардов операций умножения и сложения на один инференс и содержащей менее 25 миллионов параметров. При использовании ансамбля из 4 моделей и оценки по нескольким кропам мы получаем ошибку top-5 3,5% и ошибку top-1 17,3% на валидационном наборе, а также ошибку top-5 3,6% на официальном тестовом наборе.
Key Findings
1
Ансамбль из четырех моделей с многокропочной обработкой достигает ошибок 17,3% по top-1 и 3,5% по top-5 на валидации.
2
На валидационном наборе ILSVRC 2012 предложенная сеть достигает ошибки 21,2% по top-1 и 5,6% по top-5 при 5 миллиардах операций multiply-add на один вывод.
3
На официальном тестовом наборе ILSVRC 2012 ансамбль достигает ошибки 3,6% по top-5.
4
В работе разработаны масштабируемые сверточные архитектуры с факторизованными свертками и агрессивной регуляризацией для повышения вычислительной эффективности.
5
Одиночная модель использует менее 25 миллионов параметров, обеспечивая существенное превосходство над предыдущим уровнем качества.
Research Object
Архитектура сверточной сети Inception для задач компьютерного зрения (масштабированные варианты)
Research Subject
масштабируемая и вычислительно эффективная архитектура сетей с факторизованными свёртками и агрессивной регуляризацией, оцениваемая по точности классификации изображений и эффективности по числу параметров и вычислительным затратам
Publication Details
Publication Date
2016-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai1
Работы, цитирующие эту статью5
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Обзор неопределённости в глубоких нейронных сетях2023
Оценка генеративных моделей в физике высоких энергий2023
Механизм самовнимания с представлениями относительных позиций2018