Мультимодальные базовые модели: от специализированных систем к универсальным помощникам
Multimodal Foundation Models: From Specialists to General-Purpose Assistants
2024-05-06
SCID: 54.1/t6xg3b82
Discuss with AI
мультимодальные LLMмультимодальные фундаментальные моделигенерация текста в изображениевизуальные backboneвизуально-языковые
Figures from the paper
Abstract (AI)
В этой монографии представлен всесторонний обзор таксономии и эволюции мультимодальных базовых моделей, демонстрирующих возможности в области зрения и зрительно-языковых задач, с акцентом на переход от специализированных моделей к универсальным помощникам. Исследовательский ландшафт охватывает пять ключевых тем, сгруппированных в два класса. (i) Мы начинаем с обзора хорошо разработанных областей исследований: мультимодальные базовые модели, предварительно обученные для конкретных целей, включая две темы — методы обучения визуальных бэкендов для визуального понимания и генерация изображений по текстовому описанию. (ii) Затем мы представляем недавние достижения в исследовательских, открытых областях: мультимодальные базовые модели, стремящиеся выполнять роль универсальных помощников, включая три темы — унифицированные визуальные модели, вдохновлённые большими языковыми моделями (LLMs), сквозное (end-to-end) обучение мультимодальных LLM и цепочка мультимодальных инструментов с LLM. Целевой аудиторией монографии являются исследователи, аспиранты и специалисты в сообществах компьютерного зрения и мультимодальных зрительно-языковых систем, стремящиеся ознакомиться с основами и последними достижениями в области мультимодальных базовых моделей.
Key Findings
1
Исследовательские направления, направленные на создание универсальных помощников, включают унифицированные визуальные модели, вдохновлённые LLM, сквозное (end-to-end) обучение мультимодальных LLM и цепочки мультимодальных инструментов с LLM.
2
К специализированным предобученным моделям относятся методы обучения визуальных бэкбонов для понимания изображений и генерация изображений из текста.
3
Обзор классифицирует исследования мультимодальных фундаментальных моделей на пять ключевых тем в двух классах: специализированные предобученные модели и исследовательские модели для универсальных помощников.
4
Целевая аудитория — исследователи, аспиранты и специалисты, желающие изучить основы и последние достижения в области визуальных и визуально-языковых мультимодальных моделей.
5
Монография подчёркивает траекторию перехода от специализированных мультимодальных моделей к универсальным мультимодальным помощникам.
Research Object
Мультимодальные фундаментальные модели с возможностями зрения и «vision-language»
Research Subject
Таксономия, эволюция и переход от специализированных мультимодальных моделей к универсальным ассистентам, включая методы обучения визуальных backbone, генерацию изображений из текста, унифицированные визуальные модели, вдохновлённые LLM, сквозное обучение мультимодальных LLM и последовательное объединение мультимодальных инструментов с LLM
Publication Details
Publication Date
2024-05-06
Journal
Publisher
ISSN
Cited by
123
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest