MS-TCT: Многомасштабный временной ConvTransformer для обнаружения действий

MS-TCT: Multi-Scale Temporal ConvTransformer for Action Detection
Michael S. Ryoo, Rui Dai, Srijan Das, Kumara Kahatapitiya, François Brémond
2022-06-01

MS-TCTМногошкальный временной ConvTransformerTemporal EncoderTemporal Scale Mixerпокадровая классификация
Обнаружение действий — важная и сложная задача, особенно в плотно размеченных наборах данных неусеченных видео. Такие данные содержат сложные временные взаимосвязи, включая составные или одновременно происходящие действия. Для обнаружения действий в этих сложных условиях критически важно эффективно захватывать как краткосрочную, так и долгосрочную временную информацию. В этой связи мы предлагаем новую сеть ConvTransformer для обнаружения действий: MS-TCT1 1. Код/Модели: https://github.com/dairui01/MS-TCT. Сеть состоит из трех основных компонентов: (1) модуля Temporal Encoder, который исследует глобальные и локальные временные взаимосвязи на нескольких временных разрешениях, (2) модуля Temporal Scale Mixer, который эффективно объединяет многомасштабные признаки, создавая унифицированное представление признаков, и (3) модуля классификации, который обучается предсказывать положение относительно центра каждого экземпляра действия во времени и выдавать покадровые предсказания классов. Наши экспериментальные результаты на нескольких сложных наборах данных, таких как Charades, TSU и MultiTHUMOS, подтверждают эффективность предложенного метода, который превосходит современные методы по всем трем наборам данных.
1
Модуль классификации изучает относительные по центру временные позиции каждого экземпляра действия и предсказывает покадровые классификационные оценки.
2
Модуль Temporal Scale Mixer объединяет многомасштабные временные признаки в единое представление признаков.
3
MS-TCT — это новая сеть ConvTransformer, разработанная для детекции действий в плотно размеченных немонтажных видео.
4
MS-TCT превосходит методы на уровне современного состояния на наборах данных Charades, TSU и MultiTHUMOS.
5
Сеть содержит Temporal Encoder, который захватывает как глобальные, так и локальные временные отношения на нескольких временных разрешениях.

Сеть ConvTransformer MS-TCT для детекции действий в неотрезанных видео

Захват и слияние многомасштабных краткосрочных и долгосрочных временных отношений для предсказания покадровых экземпляров действий и их центрово-релятивных позиций при детекции плотных (densely-labelled) действий

Publication Details
Publication Date
2022-06-01
Journal
Publisher
ISSN
Cited by
106
Access Type
Author Information
Authors
Michael S. Ryoo
Rui Dai
Srijan Das
Kumara Kahatapitiya
François Brémond
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%