Flamingo: визуальная языковая модель для обучения с небольшим числом примеров
Flamingo: a Visual Language Model for Few-Shot Learning
2022-04-29
SCID: 54.1/axxm8y2q
Discuss with AI
FlamingoВизуальная языковая модельобучение с малым количеством примеровмультимодальные веб-корпусывизуальные вопросы и ответы
Figures from the paper
Abstract (AI)
Создание моделей, которые можно быстро адаптировать к новым задачам, используя лишь несколько аннотированных примеров, является открытой проблемой в исследовании мультимодального машинного обучения. Мы представляем Flamingo, семейство визуальных языковых моделей (VLM), обладающих этой способностью. Мы предлагаем ключевые архитектурные новшества, чтобы: (i) связать мощные предварительно обученные модели только для зрения и только для языка, (ii) обрабатывать последовательности с произвольно взаимопереплетёнными визуальными и текстовыми данными, и (iii) бесшовно принимать изображения или видео в качестве входных данных. Благодаря своей гибкости модели Flamingo могут быть обучены на крупномасштабных мультимодальных веб-корпусах, содержащих произвольно взаимопереплетённый текст и изображения, что является ключом к наделению их способностями к обучению с небольшим числом примеров в контексте. Мы проводим тщательную оценку наших моделей, исследуя и измеряя их способность быстро адаптироваться к разнообразным задачам с изображениями и видео. К ним относятся задачи с открытым ответом, такие как визуальные вопросы-ответы, где модель получает вопрос, на который должна ответить; задачи создания подписей (captioning), которые оценивают способность описать сцену или событие; и задачи с закрытым набором ответов, такие как визуальные вопросы-ответы множественного выбора. Для задач, расположенных в любой точке этого спектра, одна модель Flamingo может достичь нового состояния дела в обучении с небольшим числом примеров, просто получив подсказку с примерами, специфическими для задачи. По многочисленным бенчмаркам Flamingo превосходит модели, дообученные на в тысячи раз большем объёме специализированных данных.
Key Findings
1
Одна модель Flamingo достигает нового состояния искусства в задачах few-shot по разным задачам (открытые VQA, генерация подписей и закрытые VQA) при подаче примеров, специфичных для задачи.
2
Архитектурные новшества позволяют Flamingo объединять заранее обученные модели только для зрения и только для языка и обрабатывать произвольно перемежающиеся визуальные и текстовые последовательности.
3
Flamingo может бесшовно принимать изображения и видео в качестве входа, что позволяет обучать его на крупномасштабных мультимодальных веб-корпусах с перемежающимся текстом и изображениями.
4
Flamingo — это семейство визуально-языковых моделей, разработанных для обучения с малым числом примеров в контексте мультимодальных задач.
5
Flamingo превосходит модели, дообученные на в тысячи раз большем объёме специализированных данных, на многочисленных бенчмарках.
Research Object
Семейство визуально-языковых моделей Flamingo (VLM)
Research Subject
Способность Flamingo к обучению с малого числа примеров в контексте (few-shot) для быстрой адаптации к новым мультимодальным задачам (изображения и видео) путём обработки чередующихся визуальных и текстовых входов и достижения передовых результатов на открытых и закрытых задачах зрительно-языкового понимания
Publication Details
Publication Date
2022-04-29
Journal
Publisher
ISSN
Cited by
1251
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью10
Мультимодальное обучение с трансформерами: обзор2023
Обзор мультиагентных систем на основе больших языковых моделей: рабочий процесс, инфраструктура и проблемы2024
О больших языковых моделях2024
Всесторонний обзор глубокого обучения: архитектуры, последние достижения и применения2024
Модель «зрение‑язык» для генерации медицинских отчётов и визуального ответа на вопросы: обзор2024
Обзор больших зрительных моделей и визуальной инженерии промптов2023
Управление автомобилем с помощью больших языковых моделей: объединение векторной модальности на уровне объектов для объяснимого автономного вождения2024
Интерактивная компьютерная поддержка диагностики медицинских изображений с использованием крупных языковых моделей2024
Alpha-CLIP: модель CLIP, фокусирующаяся там, где нужно2024
Бенчмаркинговая оценка, приложения и проблемы больших зрительно-языковых моделей: обзор2025