MISAнаборы данных MOSI и MOSEIмультимодальная детекция юмораМультимодальный анализ настроенийнабор данных UR_FUNNYмодально-инвариантное подпространствомодально-специфичное подпространство
Figures from the paper
Abstract (AI)
Мультимодальный анализ настроений представляет собой активно развивающуюся область исследований, использующую мультимодальные сигналы для аффективного анализа видеороликов, создаваемых пользователями. Основной подход к этой задаче заключается в разработке сложных методов слияния (фьюжна). Однако гетерогенная природа сигналов порождает распределительные разрывы между модальностями, которые представляют значительные трудности. В этой работе мы стремимся обучить эффективные представления модальностей для облегчения процесса фьюжна. Мы предлагаем новую архитектуру MISA, которая проецирует каждую модальность в два различных подпространства. Первое подпространство — инвариантно к модальности, в нём представления разных модальностей усваивают общие черты и уменьшают модальный разрыв. Второе подпространство — специфично для модальности, приватно для каждой модальности и захватывает её характерные признаки. Эти представления дают целостное представление о мультимодальных данных, которое используется для фьюжна и получения предсказаний задачи. Наши эксперименты на популярных бенчмарках по анализу настроений, MOSI и MOSEI, демонстрируют значительный прирост по сравнению с современными моделями. Мы также рассматриваем задачу мультимодального обнаружения юмора и проводим эксперименты на недавно предложенном датасете UR_FUNNY. И здесь наша модель превосходит сильные базовые методы, подтверждая полезность MISA как мультимодальной архитектуры.
Key Findings
1
Обучение отдельных инвариантных и специфических представлений улучшает объединение (fusion) и предсказания задач на мультимодальных данных.
2
MISA демонстрирует существенные улучшения по сравнению с передовыми моделями на наборах данных по сентимент-анализу MOSI и MOSEI.
3
MISA превосходит сильные базовые методы в задаче обнаружения юмора на мультимодальных данных на датасете UR_FUNNY, что показывает применимость метода за пределами сентимент-анализа.
4
MISA проецирует каждую модальность в два подпространства: модально-инвариантное подпространство для изучения общих черт и уменьшения разрывов между модальностями, и модально-специфическое подпространство для захвата характеристик модальности.
Research Object
Мульти модальный анализ сентимента пользовательских видео (мультимодальные данные: аудио, визуальные и текстовые модальности)
Research Subject
Обучение модальностно-инвариантных и модальностно-специфичных представлений (проекция в два подпространства) для уменьшения разрывов между модальностями и улучшения слияния для предсказания сентимента и смежных аффективных задач
Publication Details
Publication Date
2020-10-12
Journal
Publisher
ISSN
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest