Video Swin Transformer

Video Swin Transformer
Yue Cao, Zheng Zhang, Stephen Lin, Han Hu, Ze Liu, Yixuan Wei, Ning Jia
2022-06-01

Kinetics-400Kinetics-600Something-Something v2Swin TransformerVideo Swin Transformerраспознавание действийиндуктивное смещение локальностьюпредобученные модели изображенийпространственно-временная локальностьсоотношение скорость-точность
Сообщество компьютерного зрения переживает переход от сверточных нейронных сетей (CNN) к трансформерам, где чистые архитектуры трансформеров достигают наивысшей точности на основных бенчмарках по распознаванию видео. Эти видео-модели построены на слоях трансформера, которые глобально соединяют патчи по пространственным и временным измерениям. В данной работе мы предлагаем индуктивное смещение в сторону локальности в видео-трансформерах, что приводит к лучшему компромиссу между скоростью и точностью по сравнению с предыдущими подходами, вычислявшими self-attention глобально даже при пространственно-временной факторизации. Локальность предлагаемой видео-архитектуры реализована адаптацией Swin Transformer, разработанного для области изображений, при этом сохраняется возможность использования предобученных моделей для изображений. Наш подход демонстрирует передовые результаты на широком спектре бенчмарков по распознаванию видео, включая распознавание действий (84,9% точности top-1 на Kinetics-400 и 85,9% точности top-1 на Kinetics-600 при примерно в 20× меньшем объёме данных для предобучения и примерно в 3× меньшем размере модели) и моделирование временной структуры (69,6% точности top-1 на Something-Something v2).
1
Достигается 85.9% top-1 на Kinetics-600 при использовании примерно в 20× меньше данных для предобучения и примерно в 3× меньшего размера модели.
2
Достигается рекордная точность на наборах для распознавания видео, включая 84.9% top-1 на Kinetics-400.
3
Демонстрируется сильная способность моделирования времени: 69.6% top-1 на Something-Something v2.
4
Адаптация Swin Transformer из области изображений для видео реализует локальность и использует заранее обученные модели для изображений.
5
Введение индуктивного смещения локальности в видеотрансформеры обеспечивает лучшее соотношение скорость‑точность по сравнению с предыдущими моделями с глобальным self-attention.

Архитектура Video Swin Transformer для задач видео-распознавания

Влияние внедрения локальной индуктивной предвзятости (локальное оконное self-attention, адаптированное из Swin Transformer) на компромисс скорость–точность и качество пространственно-временного моделирования в бенчмарках по видео-распознаванию

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
2070
Access Type
Author Information
Authors
Yue Cao
Zheng Zhang
Stephen Lin
Han Hu
Ze Liu
Yixuan Wei
Ning Jia
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%