ImageNet: крупномасштабная иерархическая база изображений
ImageNet: A large-scale hierarchical image database
2009-06-01
SCID: 54.1/j9by3uj6
Discuss with AI
Amazon Mechanical TurkImageNetиерархия WordNetбаза изображений в крупном масштабераспознавание объектов и классификация изображений
Figures from the paper
Abstract (AI)
Взрывное увеличение объёма изображений в Интернете способно стимулировать разработку более сложных и устойчивых моделей и алгоритмов для индексирования, поиска, организации и взаимодействия с изображениями и мультимедийными данными. Однако вопрос о том, как такие данные можно эффективно использовать и организовать, остаётся критическим. В данной работе мы представляем новую базу данных под названием «ImageNet», крупномасштабную онтологию изображений, построенную на основе структуры WordNet. Цель ImageNet — заполнить большинство из примерно 80 000 синосет (synset) WordNet в среднем по 500–1000 чистых изображений в полном разрешении. Это приведёт к созданию десятков миллионов аннотированных изображений, организованных по семантической иерархии WordNet. В статье даётся подробный анализ текущего состояния ImageNet: 12 поддеревьев с 5 247 синосетами и в общей сложности 3,2 миллионами изображений. Мы показываем, что ImageNet существенно превосходит существующие наборы изображений по масштабу, разнообразию и точности. Построение такой крупномасштабной базы данных является сложной задачей. Мы описываем схему сбора данных с использованием Amazon Mechanical Turk. В завершение мы демонстрируем полезность ImageNet на трёх простых приложениях: распознавание объектов, классификация изображений и автоматическая кластеризация объектов. Мы надеемся, что масштаб, точность, разнообразие и иерархическая структура ImageNet предложат беспрецедентные возможности исследователям в сообществе компьютерного зрения и за его пределами.
Key Findings
1
ImageNet — это крупномасштабная онтология изображений, построенная на иерархии WordNet и нацеленная на покрытие большинства ~80 000 синонимов (synsets).
2
Утверждается, что ImageNet существенно больше, более разнообразен и более точен, чем существующие на тот момент наборы изображений.
3
Масштаб, точность, разнообразие и иерархическая структура WordNet в ImageNet позволяют применять его в задачах распознавания объектов, классификации изображений и автоматической кластеризации объектов.
4
В текущем представленном состоянии ImageNet содержит 12 поддеревьев с 5 247 synset и в общей сложности 3,2 миллиона изображений.
5
В статье описана схема сбора данных с использованием Amazon Mechanical Turk для построения этой крупной базы данных.
6
Проект планирует предоставить в среднем 500–1000 чистых изображений высокого разрешения на каждый synset, что приведёт к десяткам миллионов аннотированных изображений.
Research Object
Иерархическая большая база изображений ImageNet
Research Subject
Построение, масштаб, охват, качество аннотаций, разнообразие и иерархическая организация ImageNet (заполнение синонимных наборов WordNet сотнями изображений) и её применимость для задач распознавания объектов, классификации изображений и автоматического кластеризации объектов
Publication Details
Publication Date
2009-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью19
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Аугментация текстовых данных для глубокого обучения2021
Обзор неопределённости в глубоких нейронных сетях2023
CSWin Transformer: универсальный визуальный трансформер с перекрёстными окнами2022
GenTron: диффузионные трансформеры для генерации изображений и видео2024
Бенчмаркинговая оценка, приложения и проблемы больших зрительно-языковых моделей: обзор2025
Обнаружение цитопатических эффектов, вызванных гриппом, парагриппом и энтеровирусом, с помощью сверточной нейронной сети глубокой архитектуры2021
REPrune: отбор представительных ядер для прунинга каналов2024
Снижение сложности нейронного безпотерьного сжатия данных посредством каскадного моделирования вероятностей2025
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Согласование корреляций для дистилляции знаний2019
Обзор методов аугментации изображений для глубокого обучения2019
Обрезка каналов для ускорения очень глубоких нейронных сетей2017
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Оптимизированное сквозное сжатие изображений2016
Извлечение глубоких признаков и классификация гиперспектральных изображений на основе сверточных нейронных сетей2016
Билинейные модели CNN для точной (fine-grained) визуальной классификации2015