Классификация видео в масштабе с помощью сверточных нейронных сетей
Large-Scale Video Classification with Convolutional Neural Networks
2014-06-01
SCID: 54.1/38qed5sx
Discuss with AI
сверточные нейронные сетинабор данных YouTube-1Mклассификация видео в крупном масштабемногоуровневая фовеированная архитектурапространственно-временные сети
Figures from the paper
Abstract (AI)
Сверточные нейронные сети (CNN) зарекомендовали себя как мощный класс моделей для задач распознавания изображений. Вдохновлённые этими результатами, мы проводим всестороннюю эмпирическую оценку CNN для крупномасштабной классификации видео, используя новый набор данных из 1 миллиона видео с YouTube, принадлежащих 487 классам. Мы изучаем несколько подходов к расширению связности CNN во временной области для использования локальной пространственно-временной информации и предлагаем мультиразрешающую, фовеированную архитектуру как перспективный способ ускорения обучения. Наши лучшие пространственно-временные сети демонстрируют значительные улучшения производительности по сравнению с сильными базовыми методами на основе признаков (55,3% против 63,9%), но лишь неожиданно скромное улучшение по сравнению с моделями на одиночных кадрах (59,3% против 60,9%). Мы также исследуем обобщающую способность нашей лучшей модели, дообучая верхние слои на датасете UCF-101 для распознавания действий, и наблюдаем значительные улучшения по сравнению с базовой моделью для UCF-101 (63,3% вместо 43,9%).
Key Findings
1
Лучшие пространственно-временные CNN улучшили показатели по сравнению с сильными базовыми признаковыми методами с 55.3% до 63.9%.
2
Представлены и оценены CNN на новом большом наборе видео: 1 миллион роликов YouTube по 487 классам.
3
Предложены и исследованы несколько способов расширения связности CNN по времени, включая мультиразрешающую фовеированную архитектуру для ускорения обучения.
4
Донастройка верхних слоев лучшей модели на UCF-101 повысила точность до 63.3% по сравнению с базовой моделью UCF-101 на 43.9%.
5
Пространственно-временные CNN дали лишь скромное улучшение по сравнению с моделями на одиночных кадрах, с 59.3% до 60.9%.
Research Object
Крупномасштабный видеонабор данных из 1 миллиона YouTube-видео по 487 классам, используемый для класификации видео с помощью сверточных нейронных сетей
Research Subject
Эффективность пространственно-временных архитектур сверточных нейронных сетей (включая многомасштабные/фовеированные схемы) и одно-кадровых CNN для производительности и обобщающей способности при крупномасштабной классификации видео
Publication Details
Publication Date
2014-06-01
Journal
Publisher
ISSN
Access Type
Author Information
Download PDF
Subscribe to digest