FMSA: Мультимодальный анализ тональности социальных сетей в условиях малого числа примеров на основе интегрированного обучения с подсказками и визуально-языковых моделей

FMSA: Few-shot Multimodal Sentiment Analysis for Social Media via Integrated Prompt Learning and Vision-Language Models
Xianxun Zhu, Heyang Feng, Erik Cambria, Xiaohan Yu, José Santamaría, Xuhui Fan, Rui Wang
2026-01-01

трансформер запросов (Q-Former)мультимодальный анализ тональности в режиме few-shotобучение с помощью промптовнаборы данных социальных сетеймодели зрения и языка
Мультимодальный анализ тональности (MSA) в социальных сетях приобретает всё большее значение для понимания сложных эмоциональных проявлений, однако сталкивается с существенными трудностями в условиях ограниченных данных, когда размеченный мультимодальный контент представлен в недостаточном объёме. В данной работе представлен FMSA — новая платформа, объединяющая обучение на основе подсказок с современными визуально-языковыми моделями для обеспечения устойчивого мультимодального анализа тональности в условиях малого числа примеров. Предлагаемый подход использует учитывающий инструкции Query Transformer (Q-Former) для динамического извлечения и выравнивания визуальных признаков с текстовыми подсказками, специфичными для задачи, что улучшает межмодальное слияние. Для формирования репрезентативных наборов данных в условиях малого числа примеров вводится стратегия распределённой согласованной выборки, обеспечивающая статистическое разнообразие при ограниченных ресурсах. При оценивании на шести эталонных наборах данных социальных сетей, включая MVSA-S, MVSA-M и Twitter-Depression, FMSA превосходит современные методы, достигая на MVSA-S при использовании полного набора данных точности 63,47% и показателя F1 57,34%, а в условиях малого числа примеров — точности 61,25% и показателя F1 56,06% при использовании лишь 1% данных. Благодаря дообучению облегчённых компонентов при сохранении устойчивости предварительно обученной модели FMSA снижает риск переобучения и обеспечивает обобщаемую производительность. Кроме того, мы выпускаем тщательно отобранный набор данных для обучения в условиях малого числа примеров в качестве ресурса для научного сообщества. Данная платформа развивает мультимодальный анализ тональности, предлагая эффективное и масштабируемое решение для интерпретации мультимодальных эмоций в сценариях с ограниченными ресурсами.
1
На шести бенчмарках социальных сетей FMSA достигает точности 63,47% и F1 57,34% на MVSA-S при использовании полного объёма данных.
2
Стратегия распределённого согласованного отбора формирует статистически разнообразные и репрезентативные малые выборки при жёстких ограничениях на разметку.
3
FMSA объединяет обучение на основе инструктивных промптов с Q-Former и зрительно-языковыми моделями для выравнивания визуальных признаков и текстовых промптов при маловыборочном мультимодальном анализе тональности.
4
Дообучение облегчённых компонентов при сохранении устойчивости предварительно обученной модели снижает переобучение и улучшает обобщение; авторы также выпускают курируемый набор данных для маловыборочного обучения.
5
В маловыборочном режиме при использовании лишь 1% данных FMSA достигает точности 61,25% и F1 56,06%, превосходя современные методы.

мультимодальный анализ тональности контента социальных сетей в условиях обучения по малому числу примеров и дефицита данных

устойчивая и обобщаемая интерпретация мультимодальных эмоций посредством выравнивания и объединения кросс-модальных признаков при ограниченном объёме аннотированных данных

Publication Details
Publication Date
2026-01-01
Journal
Publisher
ISSN
Cited by
3
Access Type
Author Information
Authors
Xianxun Zhu
Heyang Feng
Erik Cambria
Xiaohan Yu
José Santamaría
Xuhui Fan
Rui Wang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%