Бенчмаркинговая оценка, приложения и проблемы больших зрительно-языковых моделей: обзор

Benchmark Evaluations, Applications, and Challenges of Large Vision Language Models: A Survey
Zongxia Li, Xiyang Wu, Hongyang Du, Huy Nghiem, Guangyao Shi
2025-01-15

модели зрения и языкабенчмарки и метрики оценкигаллюцинациимультимодальныеzero-shot классификация
Мультимодальные зрительно-языковые модели (VLM) стали преобразующей технологией на стыке компьютерного зрения и обработки естественного языка, позволяющей машинам воспринимать окружающий мир и рассуждать о нем посредством визуальных и текстовых модальностей. Например, такие модели, как CLIP [1], Claude [2] и GPT-4V [3], демонстрируют высокие способности к рассуждению и пониманию визуальных и текстовых данных и превосходят классические одномодальные модели компьютерного зрения в классификации без дополнительных примеров [4]. Несмотря на быстрый прогресс исследований и растущую популярность этих моделей в прикладных задачах, комплексный обзор существующих исследований VLM практически отсутствует, особенно для исследователей, стремящихся использовать VLM в конкретных предметных областях. В связи с этим мы представляем систематический обзор VLM по следующим направлениям: [1] сведения об основных VLM, разработанных за последние пять лет (2019–2024); [2] основные архитектуры и методы обучения этих VLM; [3] обобщение и классификация популярных бенчмарков и метрик оценки VLM; [4] приложения VLM, включая воплощённых агентов, робототехнику и генерацию видео; [5] проблемы и ограничения современных VLM, такие как галлюцинации, справедливость и безопасность. Подробные подборки, включая публикации и ссылки на репозитории моделей, представлены по адресу https://github.com/zli12321/Awesome-VLM-Papers-And-Models.git.
1
Приложения VLM охватывают области, такие как роботы-агенты в воплощённой среде, робототехника и генерация видео.
2
Текущие VLM сталкиваются с проблемами, включая галлюцинации, справедливость и безопасность, что авторы выделяют как направления для будущей работы.
3
Статья предоставляет систематический обзор основных VLM, разработанных в 2019–2024 годах, включая информацию о моделях, архитектурах и методах обучения.
4
Обзор суммирует и категоризирует популярные бенчмарки и метрики оценки, используемые для VLM.
5
Визуально-языковые модели (VLM), такие как CLIP, Claude и GPT-4V, демонстрируют сильные способности к рассуждению по визуальным и текстовым данным и превосходят одно модальные визуальные модели в zero-shot классификации.

Мультимодальные визуально-языковые модели (VLMs)

Оценка на бенчмарках, архитектуры, методы обучения, области применения и проблемы мультимодальных визуально-языковых моделей (например, бенчмарки и метрики, применения в телесных агентах/робототехнике/генерации видео и такие проблемы, как галлюцинации, справедливость и безопасность)

Publication Details
Publication Date
2025-01-15
Journal
Publisher
ISSN
Cited by
25
Access Type
Author Information
Authors
Zongxia Li
Xiyang Wu
Hongyang Du
Huy Nghiem
Guangyao Shi
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%