Лучше ли LLM, чем сообщается? Обнаружение ошибок в разметке и снижение их влияния на производительность моделей
Are LLMs Better than Reported? Detecting Label Errors and Mitigating Their Effect on Model Performance
2025-01-01
SCID: 54.1/yqtubgun
Discuss with AI
LLM-as-a-judgeSummEvalбенчмарк TRUEнаборы данных фактической согласованностиошибки разметки
Figures from the paper
Abstract (AI)
Бенчмарки в области обработки естественного языка опираются на стандартизированные наборы данных для обучения и оценки моделей и играют ключевую роль в развитии области. Традиционно экспертная разметка обеспечивает высокое качество меток; однако стоимость экспертной аннотации плохо масштабируется с растущим спросом на большие наборы данных, требуемые современными моделями. Краудсорсинг предоставляет более масштабируемое решение, но часто это происходит за счёт точности и согласованности разметки. Недавние достижения в области крупных языковых моделей (LLM) открывают новые возможности для улучшения процесса разметки, в частности для обнаружения ошибок меток в существующих наборах данных. В этой работе мы рассматриваем подход «LLM в роли судьи», использующий ансамбль LLM для пометки потенциально неправильно размеченных примеров. Мы проводим кейс-исследование на четырёх датасетах фактической согласованности из бенчмарка TRUE, охватывающих различные задачи NLP, а также на SummEval, в котором используются оценки качества резюме по шкале Лайкерта по нескольким измерениям. Мы эмпирически анализируем качество разметки существующих наборов данных и сравниваем экспертную, краудсорсинговую и LLM‑базированную разметки по показателям согласия, качества меток и эффективности, демонстрируя сильные и слабые стороны каждого метода разметки. Наши результаты показывают существенное количество ошибок в метках, которые при исправлении вызывают значительный рост заявленной производительности моделей. Это указывает на то, что многие так называемые ошибки LLM обусловлены ошибками в разметке, а не истинными сбоями моделей. Дополнительно мы обсуждаем последствия наличия неправильно размеченных данных и предлагаем методы их смягчения в процессе обучения для повышения производительности.
Key Findings
1
Кейс-исследование на четырёх датасетах фактической согласованности из бенчмарка TRUE и SummEval выявляет значительное количество ошибок в метках в этих бенчмарках.
2
Ансамбль больших языковых моделей, используемый как судья, может эффективно помечать потенциально ошибочно размеченные примеры в существующих NLP-датасетах.
3
Сравнение показывает разные сильные и слабые стороны экспертной, краудсорсинговой и основанной на LLM разметки по согласованности, качеству меток и эффективности.
4
Исправление выявленных ошибок в метках приводит к существенному повышению заявленной производительности моделей, что указывает на то, что многие «ошибки» LLM вызваны ошибками разметки, а не провалом модели.
5
В работе предложены методы смягчения последствий ошибок в метках при обучении для улучшения производительности моделей.
Research Object
Наборы данных для оценки NLP (фактической согласованности из TRUE и SummEval), используемые для обучения и оценки моделей
Research Subject
Выявление ошибок разметки с помощью LLM как судей и влияние исправления этих ошибок разметки на заявленные показатели моделей, включая сравнение экспертной, краудсорсинговой и LLM-разметки и методы смягчения влияния при обучении
Publication Details
Publication Date
2025-01-01
Journal
Publisher
ISSN
Cited by
14
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest