Kinetics-400Kinetics-600Something-Something v2Swin TransformerVideo Swin Transformerраспознавание действийиндуктивное смещение локальностьюпредобученные модели изображенийпространственно-временная локальностьсоотношение скорость-точность
Figures from the paper
Abstract (AI)
Сообщество компьютерного зрения переживает переход от сверточных нейронных сетей (CNN) к трансформерам, где чистые архитектуры трансформеров достигают наивысшей точности на основных бенчмарках по распознаванию видео. Эти видео-модели построены на слоях трансформера, которые глобально соединяют патчи по пространственным и временным измерениям. В данной работе мы предлагаем индуктивное смещение в сторону локальности в видео-трансформерах, что приводит к лучшему компромиссу между скоростью и точностью по сравнению с предыдущими подходами, вычислявшими self-attention глобально даже при пространственно-временной факторизации. Локальность предлагаемой видео-архитектуры реализована адаптацией Swin Transformer, разработанного для области изображений, при этом сохраняется возможность использования предобученных моделей для изображений. Наш подход демонстрирует передовые результаты на широком спектре бенчмарков по распознаванию видео, включая распознавание действий (84,9% точности top-1 на Kinetics-400 и 85,9% точности top-1 на Kinetics-600 при примерно в 20× меньшем объёме данных для предобучения и примерно в 3× меньшем размере модели) и моделирование временной структуры (69,6% точности top-1 на Something-Something v2).
Key Findings
1
Достигается 85.9% top-1 на Kinetics-600 при использовании примерно в 20× меньше данных для предобучения и примерно в 3× меньшего размера модели.
2
Достигается рекордная точность на наборах для распознавания видео, включая 84.9% top-1 на Kinetics-400.
3
Демонстрируется сильная способность моделирования времени: 69.6% top-1 на Something-Something v2.
4
Адаптация Swin Transformer из области изображений для видео реализует локальность и использует заранее обученные модели для изображений.
5
Введение индуктивного смещения локальности в видеотрансформеры обеспечивает лучшее соотношение скорость‑точность по сравнению с предыдущими моделями с глобальным self-attention.
Research Object
Архитектура Video Swin Transformer для задач видео-распознавания
Research Subject
Влияние внедрения локальной индуктивной предвзятости (локальное оконное self-attention, адаптированное из Swin Transformer) на компромисс скорость–точность и качество пространственно-временного моделирования в бенчмарках по видео-распознаванию
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
2070
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai10
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Исследование пределов переносного обучения с унифицированным трансформером «текст-в-текст»2019
Нелокальные нейронные сети2018
Классификация ImageNet с использованием глубоких сверточных нейронных сетей2017
Глубокое остаточное обучение для распознавания изображений2016
Adam: метод стохастической оптимизации2014
Очень глубокие сверточные сети для масштабного распознавания изображений2014
Градиентное обучение для распознавания документов1998