Визуальный диалог

Visual Dialog
Dhruv Batra, Devi Parikh, Avi Singh, Abhishek Das, Satwik Kottur, Khushi Gupta, Deshraj Jain, José M. F. Moura, Deshraj Yadav
2017-07-01

иерархический рекуррентный энкодерVisual Dialogнабор данных Visual Dialog (VisDial)диалог, связанный с изображениемоценка на основе поиска (mean reciprocal rank)
Мы предлагаем задачу Визуального диалога, требующую от ИИ-агента ведения содержательного диалога с людьми на естественном разговорном языке о визуальном контенте. Конкретно, при заданном изображении, истории диалога и вопросе об изображении агент должен увязать вопрос с изображением, вывести контекст из истории и дать точный ответ. Визуальный диалог достаточно отвязан от конкретной прикладной задачи, чтобы служить общим тестом машинного интеллекта, при этом он достаточно основан на зрении, чтобы позволять объективную оценку отдельных ответов и отслеживание прогресса по бенчмарку. Мы разработали новую протокол сбора данных для двух собеседников в чате, чтобы подготовить крупномасштабный набор данных Visual Dialog (VisDial). VisDial содержит по одному диалогу (10 пар вопрос–ответ) для примерно 140 тыс. изображений из датасета COCO, всего около 1,4 млн пар вопрос–ответ диалога. Мы предлагаем семейство нейронных энкодер–декодерных моделей для Визуального диалога с тремя энкодерами (Late Fusion, Hierarchical Recurrent Encoder и Memory Network) и двумя декодерами (генеративным и дискриминативным), которые превосходят ряд сложных базовых методов. Мы предлагаем протокол оценки на основе поиска, в котором от ИИ-агента требуется упорядочить набор кандидатных ответов и оцениваться по метрикам, таким как средний обратный ранг (mean reciprocal rank) человеческого ответа. Мы количественно измеряем разрыв между машинной и человеческой производительностью для задачи Визуального диалога посредством исследований с участием людей. Наш набор данных, код и обученные модели будут опубликованы по адресу https://visualdialog.org. В совокупности мы демонстрируем первого визуального чат-бота.
1
Собран датасет VisDial: примерно 140 тыс. изображений COCO, каждое с 1 диалогом из 10 пар вопрос-ответ, всего ~1.4 млн пар, собранных по протоколу чата двух людей.
2
Разработан протокол оценки на основе поиска (retrieval), где ответы ранжируются по кандидатам и используются метрики вроде mean-reciprocal-rank для объективной оценки ответов.
3
Введена задача Visual Dialog, требующая от ИИ вести многотуровый диалог на естественном языке, основанный на изображении и истории диалога.
4
Предложены нейронные энкодер-декодер модели с тремя энкодерами (Late Fusion, Hierarchical Recurrent Encoder, Memory Network) и двумя декодерами (генеративный, дискриминативный), превосходящие несколько сильных базовых методов.
5
Через исследования с людьми количественно оценён разрыв между машинной и человеческой производительностью по задаче Visual Dialog; датасет, код и обученные модели опубликованы.

Задача Visual Dialog и её датасет VisDial (диалоги вопрос-ответ, привязанные к изображениям)

Способность ИИ-агента понимать визуальный контент и контекст диалога для генерации или выбора точных, контекстно обусловленных ответов на вопросы об изображениях (оценка моделей и разрыв с человеческой производительностью)

Publication Details
Publication Date
2017-07-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Dhruv Batra
Devi Parikh
Avi Singh
Abhishek Das
Satwik Kottur
Khushi Gupta
Deshraj Jain
José M. F. Moura
Deshraj Yadav
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%