MS-TCT: Многомасштабный временной ConvTransformer для обнаружения действий
MS-TCT: Multi-Scale Temporal ConvTransformer for Action Detection
2022-06-01
SCID: 54.1/qrt4rm8a
Discuss with AI
MS-TCTМногошкальный временной ConvTransformerTemporal EncoderTemporal Scale Mixerпокадровая классификация
Figures from the paper
Abstract (AI)
Обнаружение действий — важная и сложная задача, особенно в плотно размеченных наборах данных неусеченных видео. Такие данные содержат сложные временные взаимосвязи, включая составные или одновременно происходящие действия. Для обнаружения действий в этих сложных условиях критически важно эффективно захватывать как краткосрочную, так и долгосрочную временную информацию. В этой связи мы предлагаем новую сеть ConvTransformer для обнаружения действий: MS-TCT1 1. Код/Модели: https://github.com/dairui01/MS-TCT. Сеть состоит из трех основных компонентов: (1) модуля Temporal Encoder, который исследует глобальные и локальные временные взаимосвязи на нескольких временных разрешениях, (2) модуля Temporal Scale Mixer, который эффективно объединяет многомасштабные признаки, создавая унифицированное представление признаков, и (3) модуля классификации, который обучается предсказывать положение относительно центра каждого экземпляра действия во времени и выдавать покадровые предсказания классов. Наши экспериментальные результаты на нескольких сложных наборах данных, таких как Charades, TSU и MultiTHUMOS, подтверждают эффективность предложенного метода, который превосходит современные методы по всем трем наборам данных.
Key Findings
1
Модуль классификации изучает относительные по центру временные позиции каждого экземпляра действия и предсказывает покадровые классификационные оценки.
2
Модуль Temporal Scale Mixer объединяет многомасштабные временные признаки в единое представление признаков.
3
MS-TCT — это новая сеть ConvTransformer, разработанная для детекции действий в плотно размеченных немонтажных видео.
4
MS-TCT превосходит методы на уровне современного состояния на наборах данных Charades, TSU и MultiTHUMOS.
5
Сеть содержит Temporal Encoder, который захватывает как глобальные, так и локальные временные отношения на нескольких временных разрешениях.
Research Object
Сеть ConvTransformer MS-TCT для детекции действий в неотрезанных видео
Research Subject
Захват и слияние многомасштабных краткосрочных и долгосрочных временных отношений для предсказания покадровых экземпляров действий и их центрово-релятивных позиций при детекции плотных (densely-labelled) действий
Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
106
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai10
Использование генеративного искусственного интеллекта для масштабирования интеллектуальных обучающих систем2023
Swin Transformer: Иерархический визуальный трансформер с использова́нием сдвинутых окон2021
Pyramid Vision Transformer: универсальный бэкоун для плотного предсказания без свёрток2021
SegFormer: простая и эффективная архитектура для семантической сегментации с использованием трансформеров2021
PVT v2: Улучшённые базовые модели с Pyramid Vision Transformer2022
Video Swin Transformer2022
CMT: сверточные нейронные сети встречаются с визуальными трансформерами2022
Изображение стоит 16×16 слов: трансформеры для распознавания изображений в масштабе2020
Сеть временных свёрток с самовниманием для обнаружения долгосрочной активности в повседневной жизни2019
Adam: метод стохастической оптимизации2014