Дообучение предварительно обученных трансформерных моделей с переносом, управляемым сходством языков, для анализа тональности в 12 региональных языках Индонезии

Language-Similarity-Guided Transfer Fine-Tuning of Pre-trained Transformer Models for Sentiment Analysis Across 12 Indonesian Regional Languages
Brian Rizqi Paradisiaca Darnoto, Dony Bahtera Firmawan
2026-05-07

перенос с учетом языкового сходствабенчмарк NusaXатрибуция токенов SHAPсходство символьных триграммкросс-языковая классификация тональности
Анализ тональности для региональных языков Индонезии сталкивается с двумя постоянными проблемами: для большинства региональных вариантов крайне мало размеченных обучающих данных, а трансформерные модели, предварительно обученные на индонезийском языке (Bahasa Indonesia), ненадёжно обобщаются на языки с существенно отличающейся морфологической структурой. Предшествующие исследования на бенчмарке NusaX в основном опирались на прямое дообучение, рассматривая каждый региональный язык независимо и не используя лингвистическую близость родственных языков в качестве сигнала для переноса. В данной работе предлагается перенос, управляемый сходством языков (Language-Similarity-Guided Transfer, LSGT), — последовательная стратегия дообучения, при которой предварительно обученная модель сначала адаптируется к языку-посреднику, выбранному на основе сходства символьных триграмм, а затем дообучается на целевом языке. Четыре трансформерные модели оцениваются на всех 12 языках NusaX с использованием официальных разбиений на обучающую, валидационную и тестовую выборки: IndoBERT, NusaBERT, mBERT и XLM-R. Качество оценивается по четырём метрикам: точности, макро-F1, макро precision и макро recall. Экспериментальные результаты показывают, что LSGT повышает макро-F1 в 44 из 48 комбинаций «модель — язык», демонстрируя, что сама стратегия дообучения является существенным фактором межъязыковой классификации тональности в условиях ограниченных ресурсов. XLM-R получает наибольшую пользу от LSGT: среднее улучшение составляет +0.137 макро-F1, а максимальный прирост достигает +0.298 для мадурского языка. Дополнительный анализ атрибуции токенов на основе SHAP показывает, что предсказания в значительной степени опираются на именованные сущности и предметно-специфические существительные, а не на лексику, выражающую тональность, что указывает на систематическое смещение на уровне набора данных, унаследованное от исходного корпуса SmSA и распространённое через конвейер перевода NusaX.
1
Стратегия дообучения существенно влияет на классификацию тональности в условиях низкоресурсного межъязыкового переноса, помимо выбора предобученной модели.
2
LSGT повышает macro F1 в 44 из 48 комбинаций моделей и языков для четырёх трансформеров и 12 региональных языков Индонезии из NusaX.
3
Метод Language-Similarity-Guided Transfer (LSGT) последовательно дообучает трансформер на языке-посреднике, выбранном по сходству символьных триграмм, а затем адаптирует его к целевому региональному языку.
4
Анализ SHAP показывает, что предсказания в значительной степени опираются на именованные сущности и предметно-специфические существительные, выявляя смещение данных, унаследованное от SmSA и распространённое через конвейер перевода NusaX.
5
Наибольшую пользу от LSGT получает XLM-R: средний прирост macro F1 составляет +0.137, а максимальный прирост +0.298 наблюдается для мадурского языка.

классификация тональности в 12 региональных языках Индонезии с использованием трансформерных моделей

влияние последовательной трансферной донастройки, управляемой языковым сходством, на эффективность межъязыкового анализа тональности и смещения в атрибуции токенов

Publication Details
Publication Date
2026-05-07
Journal
Publisher
ISSN
Cited by
2
Access Type
Author Information
Authors
Brian Rizqi Paradisiaca Darnoto
Dony Bahtera Firmawan
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%