Классификация видео в масштабе с помощью сверточных нейронных сетей

Large-Scale Video Classification with Convolutional Neural Networks
Li Fei-Fei, Andrej Karpathy, Rahul Sukthankar, George Toderici, Sanketh Shetty, Thomas Leung
2014-06-01

сверточные нейронные сетинабор данных YouTube-1Mклассификация видео в крупном масштабемногоуровневая фовеированная архитектурапространственно-временные сети
Сверточные нейронные сети (CNN) зарекомендовали себя как мощный класс моделей для задач распознавания изображений. Вдохновлённые этими результатами, мы проводим всестороннюю эмпирическую оценку CNN для крупномасштабной классификации видео, используя новый набор данных из 1 миллиона видео с YouTube, принадлежащих 487 классам. Мы изучаем несколько подходов к расширению связности CNN во временной области для использования локальной пространственно-временной информации и предлагаем мультиразрешающую, фовеированную архитектуру как перспективный способ ускорения обучения. Наши лучшие пространственно-временные сети демонстрируют значительные улучшения производительности по сравнению с сильными базовыми методами на основе признаков (55,3% против 63,9%), но лишь неожиданно скромное улучшение по сравнению с моделями на одиночных кадрах (59,3% против 60,9%). Мы также исследуем обобщающую способность нашей лучшей модели, дообучая верхние слои на датасете UCF-101 для распознавания действий, и наблюдаем значительные улучшения по сравнению с базовой моделью для UCF-101 (63,3% вместо 43,9%).
1
Лучшие пространственно-временные CNN улучшили показатели по сравнению с сильными базовыми признаковыми методами с 55.3% до 63.9%.
2
Представлены и оценены CNN на новом большом наборе видео: 1 миллион роликов YouTube по 487 классам.
3
Предложены и исследованы несколько способов расширения связности CNN по времени, включая мультиразрешающую фовеированную архитектуру для ускорения обучения.
4
Донастройка верхних слоев лучшей модели на UCF-101 повысила точность до 63.3% по сравнению с базовой моделью UCF-101 на 43.9%.
5
Пространственно-временные CNN дали лишь скромное улучшение по сравнению с моделями на одиночных кадрах, с 59.3% до 60.9%.

Крупномасштабный видеонабор данных из 1 миллиона YouTube-видео по 487 классам, используемый для класификации видео с помощью сверточных нейронных сетей

Эффективность пространственно-временных архитектур сверточных нейронных сетей (включая многомасштабные/фовеированные схемы) и одно-кадровых CNN для производительности и обобщающей способности при крупномасштабной классификации видео

Publication Details
Publication Date
2014-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Li Fei-Fei
Andrej Karpathy
Rahul Sukthankar
George Toderici
Sanketh Shetty
Thomas Leung
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%