HowTo100M: обучение текстово-видеового представления посредством просмотра ста миллионов озвученных видеоклипов

HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million\n Narrated Video Clips
Jean-Baptiste Alayrac, Antoine Miech, Ivan Laptev, Josef Šivic, Dimitri Zhukov, Makarand Tapaswi
2019-06-07

датасет HowTo100Mлокализация действийавтоматически транскрибированные повествованияпоиск видео по текстутекстово-видеовое встраивание
Для обучения текстово-видеовых представлений обычно требуется набор видеоклипов с аннотациями, подготовленными вручную. Однако создание таких наборов данных требует значительных затрат времени и ресурсов, поэтому их трудно получить в большом масштабе. В этой работе мы предлагаем вместо этого обучать такие представления на видеоданных с доступными аннотациями на естественном языке в форме автоматически транскрибированных нарраций. Работа включает три основных вклада. Во-первых, мы представляем HowTo100M — крупномасштабный набор данных, содержащий 136 миллионов видеоклипов, полученных из 1,22 миллиона озвученных обучающих веб-видеороликов, в которых люди выполняют и описывают более 23 тысяч различных визуальных задач. Процедура сбора данных является быстрой и масштабируемой и не требует дополнительной ручной аннотации. Во-вторых, мы показываем, что текстово-видеовое представление, обученное на этих данных, обеспечивает результаты уровня state of the art в задачах поиска видео по текстовому запросу и локализации действий на наборах данных с обучающими видеоматериалами, таких как YouCook2 и CrossTask. Наконец, мы демонстрируем, что это представление хорошо переносится на другие предметные области: дообучение на универсальных видеороликах с YouTube (набор данных MSR-VTT) и фильмах (набор данных LSMDC) превосходит модели, обученные только на этих наборах данных. Наш набор данных, исходный код и модели будут общедоступны по адресу: www.di.ens.fr/willow/research/howto100m/.
1
Текстово-видеовое встраивание, обученное на HowTo100M, достигает передовых результатов в поиске видео по тексту и локализации действий на наборах YouCook2 и CrossTask.
2
HowTo100M включает 136 миллионов видеоклипов из 1,22 миллиона обучающих веб-видео с повествованием, охватывающих более 23 000 визуальных задач.
3
В датасете используются автоматически расшифрованные повествования как текстовые аннотации, что обеспечивает быстрый и масштабируемый сбор данных без дополнительной ручной разметки.
4
Обученное встраивание хорошо переносится между предметными областями и после дообучения превосходит модели, обученные только на MSR-VTT или LSMDC.
5
Работа предоставляет открытые датасет, исходный код и обученные модели для крупномасштабного обучения текстово-видеовых представлений.

HowTo100M: 136 миллионов озвученных видеоклипов из 1,22 миллиона учебных веб-видео, показывающих людей, выполняющих и описывающих более 23 000 визуальных задач

Обучение текстово-видеового эмбеддинга на основе автоматически транскрибированных повествований и его эффективность при переносе для поиска видео по тексту и локализации действий в различных видеодоменах

Publication Details
Publication Date
2019-06-07
Journal
Publisher
ISSN
Access Type
Author Information
Authors
Jean-Baptiste Alayrac
Antoine Miech
Ivan Laptev
Josef Šivic
Dimitri Zhukov
Makarand Tapaswi
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%