Visual Genome: соединение языка и зрения с помощью краудсорсинговых плотных аннотаций изображений
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
2017-02-06
SCID: 54.1/9ur6wz4v
Discuss with AI
Visual Genomeплотные аннотации изображенийатрибуты объектовпарные отношения между объектамиописания регионов и пары вопрос-ответ
Figures from the paper
Abstract (AI)
Несмотря на прогресс в перцептивных задачах, таких как классификация изображений, компьютеры по-прежнему плохо справляются с когнитивными задачами, такими как описание изображений и ответы на вопросы. Когниция является ключевой для задач, которые включают не только распознавание, но и рассуждение о нашем визуальном мире. Однако модели, используемые для решения богатого содержательного наполнения изображений в когнитивных задачах, все еще обучаются с использованием тех же наборов данных, разработанных для перцептивных задач. Для успешного выполнения когнитивных задач модели должны понимать взаимодействия и отношения между объектами на изображении. На вопрос «На каком транспорте едет человек?» компьютеры должны идентифицировать объекты на изображении, а также отношения riding(man, carriage) и pulling(horse, carriage), чтобы правильно ответить, что «человек едет в конной карете». В этой статье мы представляем набор данных Visual Genome для обеспечения моделирования таких отношений. Мы собираем плотные аннотации объектов, атрибутов и отношений в каждом изображении для обучения этих моделей. В частности, наш набор данных содержит более 108K изображений, где в среднем на каждом изображении 35 объектов, 26 атрибутов и 21 попарное отношение между объектами. Мы канонизируем объекты, атрибуты, отношения и именные словосочетания в описаниях регионов и парах вопросов-ответов в синонимы WordNet. В совокупности эти аннотации представляют собой самый плотный и крупнейший набор данных описаний изображений, объектов, атрибутов, отношений и пар вопросов-ответов.
Key Findings
1
Набор содержит более 108 тыс. изображений со средними значениями на изображение: 35 объектов, 26 атрибутов и 21 парное отношение.
2
Плотные аннотации отношений предназначены для того, чтобы модели могли рассуждать об взаимодействиях (например, riding(man, carriage), pulling(horse, carriage)) для задач описания изображений и VQA.
3
Объекты, атрибуты, отношения, описания регионов и пары вопрос-ответ канонизированы в синосеты WordNet.
4
Набор данных Visual Genome предоставляет плотные аннотации объектов, атрибутов и отношений для поддержки задач визуального мышления.
5
Visual Genome является самым плотным и крупнейшим набором данных описаний изображений, объектов, атрибутов, отношений и пар вопрос-ответ на момент публикации.
Research Object
Набор данных Visual Genome с плотными аннотациями изображений (объекты, атрибуты, отношения, описания регионов и пары вопрос–ответ)
Research Subject
Обеспечение моделирования взаимодействий и отношений между объектами на изображениях посредством сборa плотных аннотаций (объекты, атрибуты, попарные отношения, описания регионов и QA) и канонизации их в синсеты WordNet
Publication Details
Publication Date
2017-02-06
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest