Бенчмаркинговая оценка, приложения и проблемы больших зрительно-языковых моделей: обзор
Benchmark Evaluations, Applications, and Challenges of Large Vision Language Models: A Survey
2025-01-15
SCID: 54.1/hytx9jqy
Discuss with AI
модели зрения и языкабенчмарки и метрики оценкигаллюцинациимультимодальныеzero-shot классификация
Figures from the paper
Abstract (AI)
Мультимодальные зрительно-языковые модели (VLM) стали преобразующей технологией на стыке компьютерного зрения и обработки естественного языка, позволяющей машинам воспринимать окружающий мир и рассуждать о нем посредством визуальных и текстовых модальностей. Например, такие модели, как CLIP [1], Claude [2] и GPT-4V [3], демонстрируют высокие способности к рассуждению и пониманию визуальных и текстовых данных и превосходят классические одномодальные модели компьютерного зрения в классификации без дополнительных примеров [4]. Несмотря на быстрый прогресс исследований и растущую популярность этих моделей в прикладных задачах, комплексный обзор существующих исследований VLM практически отсутствует, особенно для исследователей, стремящихся использовать VLM в конкретных предметных областях. В связи с этим мы представляем систематический обзор VLM по следующим направлениям: [1] сведения об основных VLM, разработанных за последние пять лет (2019–2024); [2] основные архитектуры и методы обучения этих VLM; [3] обобщение и классификация популярных бенчмарков и метрик оценки VLM; [4] приложения VLM, включая воплощённых агентов, робототехнику и генерацию видео; [5] проблемы и ограничения современных VLM, такие как галлюцинации, справедливость и безопасность. Подробные подборки, включая публикации и ссылки на репозитории моделей, представлены по адресу https://github.com/zli12321/Awesome-VLM-Papers-And-Models.git.
Key Findings
1
Приложения VLM охватывают области, такие как роботы-агенты в воплощённой среде, робототехника и генерация видео.
2
Текущие VLM сталкиваются с проблемами, включая галлюцинации, справедливость и безопасность, что авторы выделяют как направления для будущей работы.
3
Статья предоставляет систематический обзор основных VLM, разработанных в 2019–2024 годах, включая информацию о моделях, архитектурах и методах обучения.
4
Обзор суммирует и категоризирует популярные бенчмарки и метрики оценки, используемые для VLM.
5
Визуально-языковые модели (VLM), такие как CLIP, Claude и GPT-4V, демонстрируют сильные способности к рассуждению по визуальным и текстовым данным и превосходят одно модальные визуальные модели в zero-shot классификации.
Research Object
Мультимодальные визуально-языковые модели (VLMs)
Research Subject
Оценка на бенчмарках, архитектуры, методы обучения, области применения и проблемы мультимодальных визуально-языковых моделей (например, бенчмарки и метрики, применения в телесных агентах/робототехнике/генерации видео и такие проблемы, как галлюцинации, справедливость и безопасность)
Publication Details
Publication Date
2025-01-15
Journal
Publisher
ISSN
Cited by
25
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai11
Обзор методов оценки больших языковых моделей2024
Flamingo: визуальная языковая модель для обучения с небольшим числом примеров2022
GPT-NeoX-20B: Открытая авторегрессивная языковая модель2022
GQA: обучение обобщённых трансформерных моделей с grouped-query attention на основе чекпоинтов с многоголовым вниманием2023
Модель «зрение‑язык» для генерации медицинских отчётов и визуального ответа на вопросы: обзор2024
Управление автомобилем с помощью больших языковых моделей: объединение векторной модальности на уровне объектов для объяснимого автономного вождения2024
NaVILA: Модель Зрение–Язык–Действие для навигации ногоподобного робота2024
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Интеллект, компилируемый через аффордансы: наблюдаемое сопоставление когнитивных импедансов для LLM-интегрированных систем без мета-доступа2020
Visual Genome: соединение языка и зрения с помощью краудсорсинговых плотных аннотаций изображений2017
ImageNet: крупномасштабная иерархическая база изображений2009