Билинейные модели CNN для точной (fine-grained) визуальной классификации
Bilinear CNN Models for Fine-Grained Visual Recognition
2015-12-01
SCID: 54.1/sptdjez8
Discuss with AI
обобщение Fisher vector / VLAD / O2Pbilinear CNNсквозная (end-to-end) тренировка с CNN-экстракторами признаковтонкозернистая визуальная классификациявнешнее произведение и объединение (outer product pooling)
Figures from the paper
Abstract (AI)
Мы предлагаем билинейные модели — архитектуру распознавания, состоящую из двух извлекателей признаков, выходы которых перемножаются с помощью внешнего произведения в каждой позиции изображения и агрегируются (пулингуются) для получения описателя изображения. Такая архитектура может моделировать локальные попарные взаимодействия признаков с инвариантностью к сдвигам, что особенно полезно для точной (fine-grained) категоризации. Она также обобщает различные беспорядочные текстурные дескрипторы, такие как Fisher Vector, VLAD и O2P. Мы приводим эксперименты с билинейными моделями, где извлекатели признаков основаны на сверточных нейронных сетях. Билинейная форма упрощает вычисление градиентов и позволяет обучать обе сети в режиме end-to-end, используя только метки изображений. Используя сети, инициализированные по набору ImageNet с последующим дообучением на целевой области, мы достигаем точности 84.1% на наборе CUB-200-2011, требуя на этапе обучения лишь меток категорий. Мы приводим эксперименты и визуализации, анализирующие влияние дообучения и выбора двух сетей на скорость и точность моделей. Результаты показывают, что архитектура выгодно сравнивается с существующим состоянием искусства на ряде наборов для тонкой классификации, при этом будучи существенно проще и легче в обучении. Более того, наша наиболее точная модель достаточно эффективна и работает с частотой 8 кадров/с на GPU NVIDIA Tesla K40. Исходный код полной системы будет доступен по адресу http://vis-www.cs.umass.edu/bcnn.
Key Findings
1
Bilinear CNN обобщают беспорядочные текстурные дескрипторы, такие как Fisher vector, VLAD и O2P.
2
Билинейные модели перемножают выходы двух извлекателей признаков внешним произведением в каждой позиции изображения и свёрткой получают дескриптор изображения.
3
Архитектура сопоставима или лучше по качеству с текущим state-of-the-art на нескольких наборах для тонкой классификации, при этом существенно проще и легче в обучении.
4
Архитектура моделирует локальные попарные взаимодействия признаков с трансляционной инвариантностью, полезной для тонкой гранулярной классификации.
5
Билинейная форма упрощает вычисление градиентов и позволяет обучать обе сети end-to-end, используя только метки категорий изображений.
6
Самая точная модель работает примерно с частотой 8 кадров/с на NVIDIA Tesla K40 GPU, что указывает на практическую эффективность.
7
Сеть, инициализированная по ImageNet и дообученная на домене, достигает 84.1% точности на CUB-200-2011, используя только метки категорий при обучении.
Research Object
Архитектура распознавания Bilinear CNN, которая перемножает выходы двух экстракторов признаков через внешнее произведение в каждой точке изображения и агрегирует их в дескриптор изображения
Research Subject
Моделирование и оценка локальных попарных взаимодействий признаков для тонкодифференцированного визуального распознавания, включая обучение (сквозная донастройка), точность на тонкодифференцированных наборах данных, вычислительную эффективность и влияние выбора сетей
Publication Details
Publication Date
2015-12-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest