Билинейные модели CNN для точной (fine-grained) визуальной классификации

Bilinear CNN Models for Fine-Grained Visual Recognition
Subhransu Maji, Tsung‐Yu Lin, Aruni RoyChowdhury
2015-12-01

обобщение Fisher vector / VLAD / O2Pbilinear CNNсквозная (end-to-end) тренировка с CNN-экстракторами признаковтонкозернистая визуальная классификациявнешнее произведение и объединение (outer product pooling)
Мы предлагаем билинейные модели — архитектуру распознавания, состоящую из двух извлекателей признаков, выходы которых перемножаются с помощью внешнего произведения в каждой позиции изображения и агрегируются (пулингуются) для получения описателя изображения. Такая архитектура может моделировать локальные попарные взаимодействия признаков с инвариантностью к сдвигам, что особенно полезно для точной (fine-grained) категоризации. Она также обобщает различные беспорядочные текстурные дескрипторы, такие как Fisher Vector, VLAD и O2P. Мы приводим эксперименты с билинейными моделями, где извлекатели признаков основаны на сверточных нейронных сетях. Билинейная форма упрощает вычисление градиентов и позволяет обучать обе сети в режиме end-to-end, используя только метки изображений. Используя сети, инициализированные по набору ImageNet с последующим дообучением на целевой области, мы достигаем точности 84.1% на наборе CUB-200-2011, требуя на этапе обучения лишь меток категорий. Мы приводим эксперименты и визуализации, анализирующие влияние дообучения и выбора двух сетей на скорость и точность моделей. Результаты показывают, что архитектура выгодно сравнивается с существующим состоянием искусства на ряде наборов для тонкой классификации, при этом будучи существенно проще и легче в обучении. Более того, наша наиболее точная модель достаточно эффективна и работает с частотой 8 кадров/с на GPU NVIDIA Tesla K40. Исходный код полной системы будет доступен по адресу http://vis-www.cs.umass.edu/bcnn.
1
Bilinear CNN обобщают беспорядочные текстурные дескрипторы, такие как Fisher vector, VLAD и O2P.
2
Билинейные модели перемножают выходы двух извлекателей признаков внешним произведением в каждой позиции изображения и свёрткой получают дескриптор изображения.
3
Архитектура сопоставима или лучше по качеству с текущим state-of-the-art на нескольких наборах для тонкой классификации, при этом существенно проще и легче в обучении.
4
Архитектура моделирует локальные попарные взаимодействия признаков с трансляционной инвариантностью, полезной для тонкой гранулярной классификации.
5
Билинейная форма упрощает вычисление градиентов и позволяет обучать обе сети end-to-end, используя только метки категорий изображений.
6
Самая точная модель работает примерно с частотой 8 кадров/с на NVIDIA Tesla K40 GPU, что указывает на практическую эффективность.
7
Сеть, инициализированная по ImageNet и дообученная на домене, достигает 84.1% точности на CUB-200-2011, используя только метки категорий при обучении.

Архитектура распознавания Bilinear CNN, которая перемножает выходы двух экстракторов признаков через внешнее произведение в каждой точке изображения и агрегирует их в дескриптор изображения

Моделирование и оценка локальных попарных взаимодействий признаков для тонкодифференцированного визуального распознавания, включая обучение (сквозная донастройка), точность на тонкодифференцированных наборах данных, вычислительную эффективность и влияние выбора сетей

Publication Details
Publication Date
2015-12-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Subhransu Maji
Tsung‐Yu Lin
Aruni RoyChowdhury
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%