Агенты на основе больших языковых моделей для обучения работе с инструментами: обзор

LLM-Based Agents for Tool Learning: A Survey
Weikai Xu, Chengrui Huang, Shen Gao, Shuo Shang
2025-06-26

агенты на основе больших языковых моделеймультимодальные инструментыобучение использованию инструментовпланирование использования инструментовпоиск инструментов
Люди, способные создавать и использовать инструменты, могут выполнять задачи, значительно превосходящие их врождённые способности, и такая парадигма интеграции с инструментами, возможно, не ограничивается только человеком. В последнее время большие языковые модели (LLM) продемонстрировали огромный потенциал в различных областях благодаря своим уникальным способностям к планированию и рассуждению. Однако из-за недостатков обучающих данных и свойственных моделям галлюцинаций многие задачи по-прежнему выходят за пределы их возможностей. Поэтому интеграция LLM и инструментов в агентов, обучающихся работе с инструментами, стала новым актуальным направлением исследований. В данной статье мы проводим систематическое исследование и всесторонний обзор агентов, обучающихся работе с инструментами. Сначала мы вводим определение задачи обучения работе с инструментами для агентов, а затем описываем типичную архитектуру моделей, обучающихся работе с инструментами. Поскольку эти инструменты определяются пользователями, LLM не знают, какие инструменты доступны и какие функции они выполняют. Следовательно, LLM должны сначала находить подходящие инструменты, а методы поиска инструментов мы разделяем на две категории: основанные на обучении и не основанные на обучении. Для точного выполнения пользовательской задачи важно разложить её на несколько подзадач и выполнить их в правильном порядке. Далее мы рассматриваем методы планирования использования инструментов и систематизируем существующие работы в зависимости от того, опирается ли планирование на встроенные способности модели к рассуждению или использует внешние инструменты рассуждения. В связи с быстрым развитием этой области мы также рассматриваем новое перспективное направление — использование мультимодальных инструментов совместно с LLM. Кроме того, мы обобщаем существующие общедоступные эталонные наборы и метрики оценки, уделяя внимание их масштабу, составу, методам расчёта и измерениям оценки. Затем мы рассматриваем несколько сценариев применения методов обучения работе с инструментами на основе LLM. Наконец, мы обсуждаем вопросы безопасности и этики, связанные с обучением работе с инструментами.
1
Формализуется задача обучения использованию инструментов и систематизируются типичные архитектуры агентов для интеграции LLM с пользовательскими инструментами.
2
В статье представлено систематическое исследование и всесторонний обзор агентов, обучающихся использованию инструментов на основе LLM.
3
Обзор охватывает мультимодальное использование инструментов, открытые бенчмарки, метрики оценки, прикладные сценарии, а также вопросы безопасности и этики.
4
Методы планирования использования инструментов классифицируются по опоре на собственные способности модели к рассуждению или на внешние инструменты рассуждения для декомпозиции задач и упорядоченного выполнения.
5
Методы поиска инструментов разделены на основанные на обучении и не использующие обучение, поскольку LLM изначально не знают доступные инструменты и их функции.

агенты обучения использованию инструментов на основе больших языковых моделей (LLM)

их архитектуры, методы поиска и планирования использования инструментов, применение мультимодальных инструментов, бенчмарки, метрики оценки, области применения, а также вопросы безопасности и этики

Publication Details
Publication Date
2025-06-26
Journal
Publisher
ISSN
Cited by
45
Access Type
Author Information
Authors
Weikai Xu
Chengrui Huang
Shen Gao
Shuo Shang
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%