Обзор методов оценки больших языковых моделей

A Survey on Evaluation of Large Language Models
Yue Zhang, Philip S. Yu, Yupeng Chang, Xu Wang, Jindong Wang, Yuan Wu, Linyi Yang, Kaijie Zhu, Hao Chen, Xiaoyuan Yi, Cunxiang Wang, Yidong Wang, Wei Ye, Yi Chang, Qiang Yang, Xing Xie
2024-01-23

этика искусственного интеллектаоценка LLMоценочные бенчмаркибольшие языковые моделиоценка рассуждений
Большие языковые модели (LLM) приобретают всё большую популярность в академической и промышленной сферах благодаря беспрецедентно высокой эффективности в различных приложениях. Поскольку LLM продолжают играть важную роль как в научных исследованиях, так и в повседневном использовании, их оценка становится всё более критически важной — не только на уровне отдельных задач, но и на уровне общества для лучшего понимания потенциальных рисков, связанных с этими моделями. В последние годы были предприняты значительные усилия по изучению LLM с различных точек зрения. В данной статье представлен всесторонний обзор методов оценки LLM, сосредоточенный на трёх ключевых аспектах: что оценивать, где оценивать и как оценивать. Во-первых, мы рассматриваем задачи оценки, включая общие задачи обработки естественного языка, рассуждение, применение в медицине, этику, образование, естественные и социальные науки, приложения с использованием агентов и другие области. Во-вторых, мы отвечаем на вопросы «где» и «как», подробно рассматривая методы оценки и эталонные тесты, которые являются важнейшими компонентами оценки производительности LLM. Затем мы обобщаем случаи успешного и неуспешного применения LLM в различных задачах. Наконец, мы освещаем несколько будущих проблем, связанных с оценкой LLM. Наша цель — предоставить исследователям в области оценки LLM ценные сведения, способствующие разработке более эффективных LLM. Основной тезис заключается в том, что оценку следует рассматривать как самостоятельную важную научную дисциплину, способную лучше поддержать развитие LLM. Мы постоянно обновляем соответствующие материалы с открытым исходным кодом по адресу: https://github.com/MLGroupJLU/LLM-eval-survey
1
Рассматриваются задачи из общей обработки естественного языка, рассуждений, медицины, этики, образования, естественных и социальных наук, а также применения агентов.
2
Обобщаются успешные и неудачные случаи применения LLM, что подчёркивает необходимость учитывать как возможности, так и ограничения и риски моделей.
3
Методы оценивания и бенчмарки анализируются как ключевые компоненты измерения производительности LLM в различных условиях.
4
Обзор выделяет будущие проблемы и утверждает, что оценивание LLM должно стать самостоятельной важной дисциплиной для развития более эффективных моделей.
5
Обзор систематизирует оценивание больших языковых моделей по трём измерениям: что оценивать, где оценивать и как оценивать.

Большие языковые модели (LLMs)

оценка LLM в различных задачах и областях, с использованием методов и бенчмарков, включая анализ общественных рисков

Publication Details
Publication Date
2024-01-23
Journal
Publisher
ISSN
Cited by
2771
Access Type
Author Information
Authors
Yue Zhang
Philip S. Yu
Yupeng Chang
Xu Wang
Jindong Wang
Yuan Wu
Linyi Yang
Kaijie Zhu
Hao Chen
Xiaoyuan Yi
Cunxiang Wang
Yidong Wang
Wei Ye
Yi Chang
Qiang Yang
Xing Xie
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%