E-VRAG: Повышение качества понимания длинных видео с помощью ресурсоэффективной генерации с поддержкой поиска
E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation
2025-08-03
SCID: 54.1/bqnaygtv
Discuss with AI
E-VRAGснижение вычислительных затратпредфильтрация кадровоценка кадровглобальное статистическое распределение межкадровых оценокиерархическая декомпозиция запросалегковесная VLMпонимание длинных видеомультивидовое вопросно-ответное представлениеизвлечение с генерацией (RAG)video RAG
Figures from the paper
Abstract (AI)
Модели для работы с визуальной информацией и текстом (vision-language models, VLMs) обеспечили существенный прогресс в понимании видео благодаря возможностям межмодального рассуждения. Однако их эффективность ограничена узким окном контекста и высоким вычислительным расходом при обработке длинных видео, содержащих тысячи кадров. Генерация с поддержкой поиска (retrieval-augmented generation, RAG) решает эту проблему путем выбора только наиболее релевантных кадров в качестве входных данных, что уменьшает вычислительную нагрузку. Тем не менее существующие методы видео RAG испытывают трудности при балансировке эффективности поиска и точности, особенно при работе с разнообразным и сложным видеоконтентом. Для преодоления этих ограничений мы предлагаем E-VRAG — новую и эффективную схему видео RAG для понимания видео. Сначала мы применяем предварительную фильтрацию кадров на основе иерархического разложения запросов, чтобы устранить нерелевантные кадры и сократить вычислительные затраты на уровне данных. Затем мы используем легковесную VLM для ранжирования кадров, что дополнительно снижает вычислительные затраты на уровне модели. Кроме того, мы предлагаем стратегию поиска кадров, использующую глобальное статистическое распределение межкадровых оценок для смягчения потенциального снижения производительности при использовании легковесной VLM. Наконец, мы вводим схему многовидового вопросно-ответного анализа для извлеченных кадров, повышающую способность VLM извлекать и понимать информацию из длинных видеоконтекстов. Эксперименты на четырех публичных бенчмарках показывают, что E-VRAG обеспечивает примерно 70% сокращение вычислительных затрат и более высокую точность по сравнению с базовыми методами, при этом дополнительное обучение не требуется. Эти результаты демонстрируют эффективность E-VRAG в повышении как эффективности, так и точности задач видео RAG.
Key Findings
1
Стратегия выборки кадров с учётом глобального статистического распределения межкадровых оценок снижает деградацию производительности при использовании лёгкой VLM.
2
Шаг предварительной фильтрации кадров с иерархическим разложением запроса удаляет нерелевантные кадры, снижая вычислительные затраты на уровне данных.
3
Для оценки кадров используется легковесная визуально-языковая модель, что дополнительно сокращает вычислительные затраты на уровне модели.
4
Схема мультивидового ответа на вопросы по выбранным кадрам улучшает способность VLM извлекать и понимать информацию из длинных видеоконтекстов.
5
E-VRAG — новая архитектура retrieval-augmented generation (RAG) для понимания длинных видео с экономией ресурсов.
6
На четырёх публичных бенчмарках E-VRAG достигает примерно 70% сокращения вычислительных затрат и более высокой точности по сравнению с базовыми методами без дополнительного обучения.
Research Object
Длинные видео, обрабатываемые для понимания видео с использованием retrieval-augmented generation (video RAG)
Research Subject
Ресурсо-эффективные методы retrieval-augmented generation (E-VRAG) для отбора и оценки релевантных кадров и многовидового ответа на вопросы с целью повышения вычислительной эффективности и точности при понимании длинных видео
Publication Details
Publication Date
2025-08-03
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest