Мультимодальные базовые модели: от специализированных систем к универсальным помощникам

Multimodal Foundation Models: From Specialists to General-Purpose Assistants
Linjie Li, Zhengyuan Yang, Zhe Gan, Jianfeng Gao, Chunyuan Li, Lijuan Wang, Jianwei Yang
2024-05-06

мультимодальные LLMмультимодальные фундаментальные моделигенерация текста в изображениевизуальные backboneвизуально-языковые
В этой монографии представлен всесторонний обзор таксономии и эволюции мультимодальных базовых моделей, демонстрирующих возможности в области зрения и зрительно-языковых задач, с акцентом на переход от специализированных моделей к универсальным помощникам. Исследовательский ландшафт охватывает пять ключевых тем, сгруппированных в два класса. (i) Мы начинаем с обзора хорошо разработанных областей исследований: мультимодальные базовые модели, предварительно обученные для конкретных целей, включая две темы — методы обучения визуальных бэкендов для визуального понимания и генерация изображений по текстовому описанию. (ii) Затем мы представляем недавние достижения в исследовательских, открытых областях: мультимодальные базовые модели, стремящиеся выполнять роль универсальных помощников, включая три темы — унифицированные визуальные модели, вдохновлённые большими языковыми моделями (LLMs), сквозное (end-to-end) обучение мультимодальных LLM и цепочка мультимодальных инструментов с LLM. Целевой аудиторией монографии являются исследователи, аспиранты и специалисты в сообществах компьютерного зрения и мультимодальных зрительно-языковых систем, стремящиеся ознакомиться с основами и последними достижениями в области мультимодальных базовых моделей.
1
Исследовательские направления, направленные на создание универсальных помощников, включают унифицированные визуальные модели, вдохновлённые LLM, сквозное (end-to-end) обучение мультимодальных LLM и цепочки мультимодальных инструментов с LLM.
2
К специализированным предобученным моделям относятся методы обучения визуальных бэкбонов для понимания изображений и генерация изображений из текста.
3
Обзор классифицирует исследования мультимодальных фундаментальных моделей на пять ключевых тем в двух классах: специализированные предобученные модели и исследовательские модели для универсальных помощников.
4
Целевая аудитория — исследователи, аспиранты и специалисты, желающие изучить основы и последние достижения в области визуальных и визуально-языковых мультимодальных моделей.
5
Монография подчёркивает траекторию перехода от специализированных мультимодальных моделей к универсальным мультимодальным помощникам.

Мультимодальные фундаментальные модели с возможностями зрения и «vision-language»

Таксономия, эволюция и переход от специализированных мультимодальных моделей к универсальным ассистентам, включая методы обучения визуальных backbone, генерацию изображений из текста, унифицированные визуальные модели, вдохновлённые LLM, сквозное обучение мультимодальных LLM и последовательное объединение мультимодальных инструментов с LLM

Publication Details
Publication Date
2024-05-06
Journal
Publisher
ISSN
Cited by
123
Access Type
Author Information
Authors
Linjie Li
Zhengyuan Yang
Zhe Gan
Jianfeng Gao
Chunyuan Li
Lijuan Wang
Jianwei Yang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%