Обзор методов оценки больших языковых моделей
A Survey on Evaluation of Large Language Models
2024-01-23
SCID: 54.1/ka2f7qhe
Discuss with AI
этика искусственного интеллектаоценка LLMоценочные бенчмаркибольшие языковые моделиоценка рассуждений
Figures from the paper
Abstract (AI)
Большие языковые модели (LLM) приобретают всё большую популярность в академической и промышленной сферах благодаря беспрецедентно высокой эффективности в различных приложениях. Поскольку LLM продолжают играть важную роль как в научных исследованиях, так и в повседневном использовании, их оценка становится всё более критически важной — не только на уровне отдельных задач, но и на уровне общества для лучшего понимания потенциальных рисков, связанных с этими моделями. В последние годы были предприняты значительные усилия по изучению LLM с различных точек зрения. В данной статье представлен всесторонний обзор методов оценки LLM, сосредоточенный на трёх ключевых аспектах: что оценивать, где оценивать и как оценивать. Во-первых, мы рассматриваем задачи оценки, включая общие задачи обработки естественного языка, рассуждение, применение в медицине, этику, образование, естественные и социальные науки, приложения с использованием агентов и другие области. Во-вторых, мы отвечаем на вопросы «где» и «как», подробно рассматривая методы оценки и эталонные тесты, которые являются важнейшими компонентами оценки производительности LLM. Затем мы обобщаем случаи успешного и неуспешного применения LLM в различных задачах. Наконец, мы освещаем несколько будущих проблем, связанных с оценкой LLM. Наша цель — предоставить исследователям в области оценки LLM ценные сведения, способствующие разработке более эффективных LLM. Основной тезис заключается в том, что оценку следует рассматривать как самостоятельную важную научную дисциплину, способную лучше поддержать развитие LLM. Мы постоянно обновляем соответствующие материалы с открытым исходным кодом по адресу: https://github.com/MLGroupJLU/LLM-eval-survey
Key Findings
1
Рассматриваются задачи из общей обработки естественного языка, рассуждений, медицины, этики, образования, естественных и социальных наук, а также применения агентов.
2
Обобщаются успешные и неудачные случаи применения LLM, что подчёркивает необходимость учитывать как возможности, так и ограничения и риски моделей.
3
Методы оценивания и бенчмарки анализируются как ключевые компоненты измерения производительности LLM в различных условиях.
4
Обзор выделяет будущие проблемы и утверждает, что оценивание LLM должно стать самостоятельной важной дисциплиной для развития более эффективных моделей.
5
Обзор систематизирует оценивание больших языковых моделей по трём измерениям: что оценивать, где оценивать и как оценивать.
Research Object
Большие языковые модели (LLMs)
Research Subject
оценка LLM в различных задачах и областях, с использованием методов и бенчмарков, включая анализ общественных рисков
Publication Details
Publication Date
2024-01-23
Journal
Publisher
ISSN
Cited by
2771
Access Type
Author Information
Download PDF
Subscribe to digest
Источники этой статьи в scid.ai3
Работы, цитирующие эту статью4
Обзор автономных агентов на основе больших языковых моделей2024
Обзор больших языковых моделей: архитектуры, приложения, таксономии, нерешённые вопросы и проблемы2024
Сравнительный анализ глубоких нейронных сетей и больших языковых моделей для аспектно-ориентированного анализа тональности2024
Бенчмаркинговая оценка, приложения и проблемы больших зрительно-языковых моделей: обзор2025