E-VRAG: Повышение качества понимания длинных видео с помощью ресурсоэффективной генерации с поддержкой поиска

E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
Zeyu Xu, J Zhang, Qiang Wang, Yi Liu
2025-08-03

E-VRAGснижение вычислительных затратпредфильтрация кадровоценка кадровглобальное статистическое распределение межкадровых оценокиерархическая декомпозиция запросалегковесная VLMпонимание длинных видеомультивидовое вопросно-ответное представлениеизвлечение с генерацией (RAG)video RAG
Модели для работы с визуальной информацией и текстом (vision-language models, VLMs) обеспечили существенный прогресс в понимании видео благодаря возможностям межмодального рассуждения. Однако их эффективность ограничена узким окном контекста и высоким вычислительным расходом при обработке длинных видео, содержащих тысячи кадров. Генерация с поддержкой поиска (retrieval-augmented generation, RAG) решает эту проблему путем выбора только наиболее релевантных кадров в качестве входных данных, что уменьшает вычислительную нагрузку. Тем не менее существующие методы видео RAG испытывают трудности при балансировке эффективности поиска и точности, особенно при работе с разнообразным и сложным видеоконтентом. Для преодоления этих ограничений мы предлагаем E-VRAG — новую и эффективную схему видео RAG для понимания видео. Сначала мы применяем предварительную фильтрацию кадров на основе иерархического разложения запросов, чтобы устранить нерелевантные кадры и сократить вычислительные затраты на уровне данных. Затем мы используем легковесную VLM для ранжирования кадров, что дополнительно снижает вычислительные затраты на уровне модели. Кроме того, мы предлагаем стратегию поиска кадров, использующую глобальное статистическое распределение межкадровых оценок для смягчения потенциального снижения производительности при использовании легковесной VLM. Наконец, мы вводим схему многовидового вопросно-ответного анализа для извлеченных кадров, повышающую способность VLM извлекать и понимать информацию из длинных видеоконтекстов. Эксперименты на четырех публичных бенчмарках показывают, что E-VRAG обеспечивает примерно 70% сокращение вычислительных затрат и более высокую точность по сравнению с базовыми методами, при этом дополнительное обучение не требуется. Эти результаты демонстрируют эффективность E-VRAG в повышении как эффективности, так и точности задач видео RAG.
1
Стратегия выборки кадров с учётом глобального статистического распределения межкадровых оценок снижает деградацию производительности при использовании лёгкой VLM.
2
Шаг предварительной фильтрации кадров с иерархическим разложением запроса удаляет нерелевантные кадры, снижая вычислительные затраты на уровне данных.
3
Для оценки кадров используется легковесная визуально-языковая модель, что дополнительно сокращает вычислительные затраты на уровне модели.
4
Схема мультивидового ответа на вопросы по выбранным кадрам улучшает способность VLM извлекать и понимать информацию из длинных видеоконтекстов.
5
E-VRAG — новая архитектура retrieval-augmented generation (RAG) для понимания длинных видео с экономией ресурсов.
6
На четырёх публичных бенчмарках E-VRAG достигает примерно 70% сокращения вычислительных затрат и более высокой точности по сравнению с базовыми методами без дополнительного обучения.

Длинные видео, обрабатываемые для понимания видео с использованием retrieval-augmented generation (video RAG)

Ресурсо-эффективные методы retrieval-augmented generation (E-VRAG) для отбора и оценки релевантных кадров и многовидового ответа на вопросы с целью повышения вычислительной эффективности и точности при понимании длинных видео

Publication Details
Publication Date
2025-08-03
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Zeyu Xu
J Zhang
Qiang Wang
Yi Liu
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%