Flamingo: визуальная языковая модель для обучения с небольшим числом примеров

Flamingo: a Visual Language Model for Few-Shot Learning
Oriol Vinyals, Andrew Zisserman, Jacob Menick, Serkan Cabi, Jean-Baptiste Alayrac, Jeff Donahue, Pauline Luc, Antoine Miech, Iain Barr, Yana Hasson, Karel Lenc, Arthur Mensch, Katie Millican, Malcolm Reynolds, Roman Ring, Eliza Rutherford, Tengda Han, Zhitao Gong, Sina Samangooei, Marianne Monteiro, Sebastian Borgeaud, Andrew Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikołaj Bińkowski, Ricardo Barreira, Karen Simonyan, Alayrac, Jean-Baptiste
2022-04-29

FlamingoВизуальная языковая модельобучение с малым количеством примеровмультимодальные веб-корпусывизуальные вопросы и ответы
Создание моделей, которые можно быстро адаптировать к новым задачам, используя лишь несколько аннотированных примеров, является открытой проблемой в исследовании мультимодального машинного обучения. Мы представляем Flamingo, семейство визуальных языковых моделей (VLM), обладающих этой способностью. Мы предлагаем ключевые архитектурные новшества, чтобы: (i) связать мощные предварительно обученные модели только для зрения и только для языка, (ii) обрабатывать последовательности с произвольно взаимопереплетёнными визуальными и текстовыми данными, и (iii) бесшовно принимать изображения или видео в качестве входных данных. Благодаря своей гибкости модели Flamingo могут быть обучены на крупномасштабных мультимодальных веб-корпусах, содержащих произвольно взаимопереплетённый текст и изображения, что является ключом к наделению их способностями к обучению с небольшим числом примеров в контексте. Мы проводим тщательную оценку наших моделей, исследуя и измеряя их способность быстро адаптироваться к разнообразным задачам с изображениями и видео. К ним относятся задачи с открытым ответом, такие как визуальные вопросы-ответы, где модель получает вопрос, на который должна ответить; задачи создания подписей (captioning), которые оценивают способность описать сцену или событие; и задачи с закрытым набором ответов, такие как визуальные вопросы-ответы множественного выбора. Для задач, расположенных в любой точке этого спектра, одна модель Flamingo может достичь нового состояния дела в обучении с небольшим числом примеров, просто получив подсказку с примерами, специфическими для задачи. По многочисленным бенчмаркам Flamingo превосходит модели, дообученные на в тысячи раз большем объёме специализированных данных.
1
Одна модель Flamingo достигает нового состояния искусства в задачах few-shot по разным задачам (открытые VQA, генерация подписей и закрытые VQA) при подаче примеров, специфичных для задачи.
2
Архитектурные новшества позволяют Flamingo объединять заранее обученные модели только для зрения и только для языка и обрабатывать произвольно перемежающиеся визуальные и текстовые последовательности.
3
Flamingo может бесшовно принимать изображения и видео в качестве входа, что позволяет обучать его на крупномасштабных мультимодальных веб-корпусах с перемежающимся текстом и изображениями.
4
Flamingo — это семейство визуально-языковых моделей, разработанных для обучения с малым числом примеров в контексте мультимодальных задач.
5
Flamingo превосходит модели, дообученные на в тысячи раз большем объёме специализированных данных, на многочисленных бенчмарках.

Семейство визуально-языковых моделей Flamingo (VLM)

Способность Flamingo к обучению с малого числа примеров в контексте (few-shot) для быстрой адаптации к новым мультимодальным задачам (изображения и видео) путём обработки чередующихся визуальных и текстовых входов и достижения передовых результатов на открытых и закрытых задачах зрительно-языкового понимания

Publication Details
Publication Date
2022-04-29
Journal
Publisher
ISSN
Cited by
1251
Access Type
Author Information
Authors
Oriol Vinyals
Andrew Zisserman
Jacob Menick
Serkan Cabi
Jean-Baptiste Alayrac
Jeff Donahue
Pauline Luc
Antoine Miech
Iain Barr
Yana Hasson
Karel Lenc
Arthur Mensch
Katie Millican
Malcolm Reynolds
Roman Ring
Eliza Rutherford
Tengda Han
Zhitao Gong
Sina Samangooei
Marianne Monteiro
Sebastian Borgeaud
Andrew Brock
Aida Nematzadeh
Sahand Sharifzadeh
Mikołaj Bińkowski
Ricardo Barreira
Karen Simonyan
Alayrac, Jean-Baptiste
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%