Сравнительное исследование эмбеддингов DINOv2, I-JEPA и ViT для неконтролируемого обнаружения аномалий

Comparative Study of DINOv2, I-JEPA, and ViT Embeddings for Unsupervised Anomaly Detection
Jean-Marc Spat, Houda Chabbi-Drissi
2025-11-19

DINOv2I-JEPAVision Transformersk-Means кластеризациябезнадзорное обнаружение аномалий
В статье представлен унифицированный неконтролируемый фреймворк для визуального обнаружения аномалий (Visual Anomaly Detection, VAD) в динамических сценах с фиксированной камерой с использованием современных Vision Transformer (ViT) без дополнительной донастройки. Исследуется, достаточно ли эмбеддингов от бэкбонов, таких как общий ViT, DINOv2 и I-JEPA, в сочетании с простым подходом кластеризации для выявления аномалий. Наша методология извлекает как глобальные эмбеддинги (CLS-токен), так и локальные эмбеддинги (на уровне патчей), применяет кластеризацию (k-Means, HDBSCAN) для моделирования распределения нормальных сцен и использует масштабируемую векторную базу данных (ChromaDB) для эффективного поиска по сходству. Три бэкбона показали сопоставимую производительность, при этом общий ViT продемонстрировал небольшое, но стабильное преимущество по сбалансированной точности. Локальные эмбеддинги дали прирост сбалансированной точности на 3%, однако их последовательная обработка заметно медленнее. Это ограничение можно смягчить за счет параллелизации, что потенциально приблизит их эффективность к эффективности глобальных эмбеддингов. Напротив, глобальные эмбеддинги обеспечивают сопоставимую производительность, при этом они примерно в 256 раз быстрее, что позволяет обрабатывать пакеты кадров из 15-секундных видеосегментов в режиме, близком к реальному времени. Кластеризация k-Means и предложенная стратегия извлечения оказались наиболее эффективными, обеспечив практический компромисс с сбалансированной точностью 82%. Эти результаты указывают на то, что эмбеддинги ViT эффективны для разделения нормальных и аномальных шаблонов. Локальные эмбеддинги, по-видимому, захватывают дополнительные и релевантные сведения, и мы ожидаем, что при незначительных изменениях в стратегии детектирования их можно будет дополнительно использовать для повышения качества обнаружения аномалий.
1
Единая безнадзорная VAD-рамочная схема с использованием ViT-бэкендов (generic ViT, DINOv2, I-JEPA) без дообучения способна обнаруживать аномалии в динамичных сценах с фиксированным видом.
2
Эмбеддинги generic ViT показали небольшое, но стабильное преимущество по сбалансированной точности по сравнению с DINOv2 и I-JEPA.
3
Глобальные (CLS-токен) эмбеддинги обеспечивали сопоставимую точность обнаружения при примерно в 256 раз большей скорости, что позволяет обрабатывать партии видеосегментов по 15 с в режиме почти реального времени.
4
Локальные (на уровне патчей) эмбеддинги обеспечили прирост сбалансированной точности на 3% по сравнению с глобальными эмбеддингами, но требовали значительно большего последовательного времени обработки.
5
Локальные эмбеддинги захватывают дополнительную информацию и при умеренной корректировке стратегии детекции или параллелизации могут ещё улучшить качество обнаружения аномалий.
6
Использование масштабируемой векторной базы данных (ChromaDB) для поиска по сходству обеспечивает эффективное моделирование и извлечение распределения нормальных сцен.
7
Кластеризация k-Means в сочетании с предложенной стратегией поиска достигла сбалансированной точности 82%, представляя эффективный оперативный компромисс.

Эмбеддинги (глобальный CLS и локальные патч-эмбеддинги) из бэкендов Vision Transformer (DINOv2, I-JEPA и обобщённый ViT), используемые для безнадзорного визуального обнаружения аномалий в динамических сценах с фиксированным видом

Эффективность и компромиссы в производительности этих ViT-эмбеддингов (глобальные против локальных) в сочетании с кластеризацией и поиском (k-Means, HDBSCAN, ChromaDB) для разделения нормальных и аномальных паттернов, оцениваемые по взвешенной точности и времени обработки

Publication Details
Publication Date
2025-11-19
Journal
Publisher
ISSN
Cited by
1
Access Type
Author Information
Authors
Jean-Marc Spat
Houda Chabbi-Drissi
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%