CToolEval: китайский бенчмарк для оценки агентов на основе больших языковых моделей при взаимодействии с API в реальных условиях
CToolEval: A Chinese Benchmark for LLM-Powered Agent Evaluation in Real-World API Interactions
2024-01-01
SCID: 54.1/7m3tsnd3
Discuss with AI
взаимодействие с APIбенчмарк CToolEvalкитайские социальные приложенияагенты на основе больших языковых моделейвызов инструментов
Figures from the paper
Abstract (AI)
Оценка возможностей больших языковых моделей (LLM) как агентов при принятии решений и выполнении операционных задач имеет решающее значение для развития сервисов на основе LLM в качестве агентов. Мы предлагаем CToolEval — бенчмарк для оценки LLM в контексте приложений, ориентированных на китайское общество; он включает 398 API в 27 широко используемых приложениях (например, приложениях для покупок, карт, музыки и путешествий), охватывающих 14 предметных областей. Кроме того, мы представляем платформу оценки, имитирующую сценарии из реальной жизни, для анализа способности LLM вызывать инструменты в процессе обучения работе с инструментами и способности выполнять задачи в ходе взаимодействия с пользователем. Масштабные эксперименты с CToolEval охватывают 11 LLM и показывают, что, хотя GPT-3.5-turbo превосходит другие модели по способности вызывать инструменты, китайские LLM обычно испытывают трудности, связанные, например, с галлюцинациями и недостаточно глубоким пониманием инструментов. Наши результаты подчёркивают необходимость дальнейшего совершенствования способностей LLM к принятию решений и дают представление о путях сокращения разрыва между текущей функциональностью и производительностью на уровне агентов. Для содействия дальнейшим исследованиям, направленным на полноценное использование LLM в качестве надёжных агентов в сложных ситуациях реального мира, мы публикуем наши данные и исходный код по адресу https://github.com/tjunlp-lab/CToolEval.
Key Findings
1
CToolEval представляет китайский бенчмарк с 398 API из 27 широко используемых приложений, охватывающих 14 общественных доменов.
2
Китайские LLM часто сталкиваются с галлюцинациями и недостаточным комплексным пониманием доступных инструментов.
3
Эксперименты с 11 LLM показывают, что GPT-3.5-turbo демонстрирует лучшие результаты среди оценённых моделей по вызову инструментов.
4
Платформа моделирует реальные сценарии для оценки вызова инструментов LLM при обучении работе с инструментами и выполнения задач во взаимодействии с пользователем.
5
Результаты показывают, что современным LLM необходимо улучшить способности к принятию решений для достижения надёжной агентной работы в сложных реальных условиях.
Research Object
Агенты на основе больших языковых моделей, взаимодействующие с API в китайских социальных приложениях
Research Subject
Способности к вызову инструментов и выполнению задач, включая галлюцинации и комплексное понимание инструментов, оцениваемые в смоделированных сценариях реальной жизни
Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
6
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest