Visual Genome: соединение языка и зрения с помощью краудсорсинговых плотных аннотаций изображений

Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations
Li-Jia Li, Li Fei-Fei, Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, David A. Shamma, Michael S. Bernstein
2017-02-06

Visual Genomeплотные аннотации изображенийатрибуты объектовпарные отношения между объектамиописания регионов и пары вопрос-ответ
Несмотря на прогресс в перцептивных задачах, таких как классификация изображений, компьютеры по-прежнему плохо справляются с когнитивными задачами, такими как описание изображений и ответы на вопросы. Когниция является ключевой для задач, которые включают не только распознавание, но и рассуждение о нашем визуальном мире. Однако модели, используемые для решения богатого содержательного наполнения изображений в когнитивных задачах, все еще обучаются с использованием тех же наборов данных, разработанных для перцептивных задач. Для успешного выполнения когнитивных задач модели должны понимать взаимодействия и отношения между объектами на изображении. На вопрос «На каком транспорте едет человек?» компьютеры должны идентифицировать объекты на изображении, а также отношения riding(man, carriage) и pulling(horse, carriage), чтобы правильно ответить, что «человек едет в конной карете». В этой статье мы представляем набор данных Visual Genome для обеспечения моделирования таких отношений. Мы собираем плотные аннотации объектов, атрибутов и отношений в каждом изображении для обучения этих моделей. В частности, наш набор данных содержит более 108K изображений, где в среднем на каждом изображении 35 объектов, 26 атрибутов и 21 попарное отношение между объектами. Мы канонизируем объекты, атрибуты, отношения и именные словосочетания в описаниях регионов и парах вопросов-ответов в синонимы WordNet. В совокупности эти аннотации представляют собой самый плотный и крупнейший набор данных описаний изображений, объектов, атрибутов, отношений и пар вопросов-ответов.
1
Набор содержит более 108 тыс. изображений со средними значениями на изображение: 35 объектов, 26 атрибутов и 21 парное отношение.
2
Плотные аннотации отношений предназначены для того, чтобы модели могли рассуждать об взаимодействиях (например, riding(man, carriage), pulling(horse, carriage)) для задач описания изображений и VQA.
3
Объекты, атрибуты, отношения, описания регионов и пары вопрос-ответ канонизированы в синосеты WordNet.
4
Набор данных Visual Genome предоставляет плотные аннотации объектов, атрибутов и отношений для поддержки задач визуального мышления.
5
Visual Genome является самым плотным и крупнейшим набором данных описаний изображений, объектов, атрибутов, отношений и пар вопрос-ответ на момент публикации.

Набор данных Visual Genome с плотными аннотациями изображений (объекты, атрибуты, отношения, описания регионов и пары вопрос–ответ)

Обеспечение моделирования взаимодействий и отношений между объектами на изображениях посредством сборa плотных аннотаций (объекты, атрибуты, попарные отношения, описания регионов и QA) и канонизации их в синсеты WordNet

Publication Details
Publication Date
2017-02-06
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Li-Jia Li
Li Fei-Fei
Ranjay Krishna
Yuke Zhu
Oliver Groth
Justin Johnson
Kenji Hata
Joshua Kravitz
Stephanie Chen
Yannis Kalantidis
David A. Shamma
Michael S. Bernstein
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%