О влиянии языковых нюансов на анализ тональности с использованием больших языковых моделей: перефразирование, сарказм и эмодзи
On the Impact of Language Nuances on Sentiment Analysis With Large Language Models: Paraphrasing, Sarcasm, and Emojis
2026-01-01
SCID: 54.1/ryx22aja
Discuss with AI
состязательное расширение текстабольшие языковые моделиобнаружение сарказмаанализ тональностиперефразирование текста
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) продемонстрировали впечатляющую эффективность в решении различных задач, включая анализ тональности. Однако качество данных, особенно полученных из социальных сетей, может существенно влиять на их точность. В данном исследовании изучается влияние текстовых нюансов, включая эмодзи и сарказм, на анализ тональности, при этом особое внимание уделяется повышению качества данных с помощью методов перефразирования текста. Для восполнения недостатка размеченных данных о сарказме авторы создали набор данных из 5929 твитов с разметкой, выполненной людьми, что позволило оценить LLM в различных контекстах использования сарказма. Результаты показывают, что при дообучении LLM на предметно-ориентированных наборах данных, например связанных с ядерной энергетикой, эти модели не способны точно интерпретировать тональность при наличии сарказма из-за недостаточного разнообразия текстов; для повышения точности модели требуются внешние вмешательства, такие как удаление сарказма. Удаление сарказма повысило точность определения тональности на 17%, поскольку LLM, обученные на материалах, связанных с ядерной энергетикой, испытывали трудности при обработке саркастических твитов и достигали точности лишь 30%. Напротив, LLM, обученные на общих наборах данных твитов, охватывающих более широкий спектр тем, продемонстрировали значительное улучшение при прогнозировании тональности саркастических твитов, достигнув точности 60%; это указывает на то, что включение общетематических текстовых данных может повысить эффективность обнаружения сарказма. В исследовании также применялось состязательное расширение текстовых данных: было показано, что создание синтетических вариантов текста путем внесения небольших изменений значительно повышает робастность моделей и точность их работы с саркастическими твитами — примерно до 85%. Кроме того, перефразирование твитов с фрагментарным языком преобразовало около 40% твитов с метками низкой уверенности в твиты с метками высокой уверенности, повысив точность анализа тональности с помощью LLM на 6%. Наконец, эмодзи не оказали существенного влияния на анализ тональности текстов, связанных с ядерной энергетикой, что позволяет предположить: в определенных контекстах эмодзи могут скорее усиливать, чем раскрывать тональность.
Key Findings
1
Адвесариальное расширение данных с помощью небольших синтетических изменений текста существенно повысило устойчивость моделей и точность для саркастических твитов примерно до 85%.
2
Парафразирование твитов с фрагментарным языком превратило около 40% меток с низкой уверенностью в метки с высокой уверенностью и повысило точность анализа тональности на 6%; эмодзи не оказали значимого влияния на контент о ядерной энергетике.
3
Удаление сарказма повысило точность определения тональности на 17%, а обучение на твитах общей тематики увеличило точность для саркастических твитов до 60%.
4
Исследование создало вручную размеченный набор данных из 5 929 твитов для оценки больших языковых моделей в различных контекстах сарказма.
5
Дообучение на узкоспециализированных данных о ядерной энергетике плохо обрабатывало саркастические твиты, обеспечив лишь 30% точности определения тональности из-за ограниченного текстового разнообразия.
Research Object
Большие языковые модели, выполняющие анализ тональности твитов из социальных сетей, включая саркастические твиты и твиты о ядерной энергетике
Research Subject
Влияние сарказма, эмодзи, фрагментарного языка, перефразирования и мер по повышению разнообразия текста на точность, уверенность и устойчивость анализа тональности
Publication Details
Publication Date
2026-01-01
Journal
Publisher
ISSN
Cited by
7
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest