Лучше ли LLM, чем сообщается? Обнаружение ошибок в разметке и снижение их влияния на производительность моделей

Are LLMs Better than Reported? Detecting Label Errors and Mitigating Their Effect on Model Performance
Orgad Keller, Omer Nahum, Nitay Calderon, Idan Szpektor, Roi Reichart
2025-01-01

LLM-as-a-judgeSummEvalбенчмарк TRUEнаборы данных фактической согласованностиошибки разметки
Бенчмарки в области обработки естественного языка опираются на стандартизированные наборы данных для обучения и оценки моделей и играют ключевую роль в развитии области. Традиционно экспертная разметка обеспечивает высокое качество меток; однако стоимость экспертной аннотации плохо масштабируется с растущим спросом на большие наборы данных, требуемые современными моделями. Краудсорсинг предоставляет более масштабируемое решение, но часто это происходит за счёт точности и согласованности разметки. Недавние достижения в области крупных языковых моделей (LLM) открывают новые возможности для улучшения процесса разметки, в частности для обнаружения ошибок меток в существующих наборах данных. В этой работе мы рассматриваем подход «LLM в роли судьи», использующий ансамбль LLM для пометки потенциально неправильно размеченных примеров. Мы проводим кейс-исследование на четырёх датасетах фактической согласованности из бенчмарка TRUE, охватывающих различные задачи NLP, а также на SummEval, в котором используются оценки качества резюме по шкале Лайкерта по нескольким измерениям. Мы эмпирически анализируем качество разметки существующих наборов данных и сравниваем экспертную, краудсорсинговую и LLM‑базированную разметки по показателям согласия, качества меток и эффективности, демонстрируя сильные и слабые стороны каждого метода разметки. Наши результаты показывают существенное количество ошибок в метках, которые при исправлении вызывают значительный рост заявленной производительности моделей. Это указывает на то, что многие так называемые ошибки LLM обусловлены ошибками в разметке, а не истинными сбоями моделей. Дополнительно мы обсуждаем последствия наличия неправильно размеченных данных и предлагаем методы их смягчения в процессе обучения для повышения производительности.
1
Кейс-исследование на четырёх датасетах фактической согласованности из бенчмарка TRUE и SummEval выявляет значительное количество ошибок в метках в этих бенчмарках.
2
Ансамбль больших языковых моделей, используемый как судья, может эффективно помечать потенциально ошибочно размеченные примеры в существующих NLP-датасетах.
3
Сравнение показывает разные сильные и слабые стороны экспертной, краудсорсинговой и основанной на LLM разметки по согласованности, качеству меток и эффективности.
4
Исправление выявленных ошибок в метках приводит к существенному повышению заявленной производительности моделей, что указывает на то, что многие «ошибки» LLM вызваны ошибками разметки, а не провалом модели.
5
В работе предложены методы смягчения последствий ошибок в метках при обучении для улучшения производительности моделей.

Наборы данных для оценки NLP (фактической согласованности из TRUE и SummEval), используемые для обучения и оценки моделей

Выявление ошибок разметки с помощью LLM как судей и влияние исправления этих ошибок разметки на заявленные показатели моделей, включая сравнение экспертной, краудсорсинговой и LLM-разметки и методы смягчения влияния при обучении

Publication Details
Publication Date
2025-01-01
Journal
Publisher
ISSN
Cited by
14
Access Type
Author Information
Authors
Orgad Keller
Omer Nahum
Nitay Calderon
Idan Szpektor
Roi Reichart
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%