Бенчмаркинг агентов на основе больших языковых моделей для анализа одноклеточных омиксных данных
Benchmarking LLM-based agents for single-cell omics analysis
2026-02-25
SCID: 54.1/jb89py56
Discuss with AI
агенты на основе больших языковых моделейсистема бенчмаркинговой оценкимультиагентные фреймворкигенерация с дополнением поискаанализ одноклеточной омики
Figures from the paper
Abstract (AI)
ПРЕДПОСЫЛКИ: Стремительный рост объёма одноклеточных омиксных данных выявляет ограничения традиционных рабочих процессов анализа, основанных на ручном определении процедур. Агенты искусственного интеллекта предлагают смену парадигмы, обеспечивая адаптивное планирование, генерацию исполняемого кода, прослеживаемость решений и объединение знаний в реальном времени. Однако отсутствие комплексного бенчмарка существенно препятствует прогрессу. РЕЗУЛЬТАТЫ: Мы представляем новую систему бенчмаркинговой оценки для строгого анализа возможностей агентов в исследовании одноклеточных омиксных данных. Система включает унифицированную платформу, совместимую с различными фреймворками агентов и большими языковыми моделями (LLM); многомерные метрики для оценки синтеза когнитивных программ, взаимодействия, эффективности выполнения, интеграции биоинформатических знаний и качества выполнения задач; а также 50 разнообразных реальных задач анализа одноклеточных омиксных данных, охватывающих мультиомиксные исследования, различные виды и технологии секвенирования. Наша оценка показывает, что Grok3-beta достигает передовых результатов среди протестированных фреймворков агентов. Мультиагентные фреймворки значительно повышают эффективность взаимодействия и выполнения по сравнению с одноагентными подходами благодаря распределению специализированных ролей. Анализ вклада различных возможностей агентов показывает, что генерация высококачественного кода имеет решающее значение для успешного выполнения задач, а саморефлексия оказывает наиболее значимое общее влияние, за которой следуют генерация с дополнением поиска (RAG) и планирование. ВЫВОДЫ: Работа выявляет сохраняющиеся проблемы генерации кода, обработки длинных контекстов и контекстно-зависимого поиска знаний, создавая важную эмпирическую основу и формулируя передовые практики для разработки надёжных агентов искусственного интеллекта в вычислительной биологии.
Key Findings
1
Среди оценённых агентных фреймворков Grok3-beta продемонстрировал наилучшие результаты.
2
Высококачественная генерация кода критически важна для успешного выполнения задач, а саморефлексия оказывает наибольшее общее влияние, за ней следуют retrieval-augmented generation и планирование; сохраняются проблемы обработки длинного контекста и контекстно-зависимого поиска знаний.
3
Представлен унифицированный бенчмарк для оценки агентов на основе больших языковых моделей в анализе одноклеточной омики, совместимый с различными агентными фреймворками и языковыми моделями.
4
Мультиагентные системы повышают качество взаимодействия и эффективность выполнения по сравнению с одноагентными подходами благодаря разделению специализированных ролей.
5
Бенчмарк использует многомерные метрики и включает 50 реальных задач, охватывающих мультиомику, разные виды и технологии секвенирования.
Research Object
ИИ-агенты на основе больших языковых моделей (LLM) для анализа одноклеточных омиксных данных
Research Subject
Способности и производительность агентов при планировании, генерации кода, совместной работе, интеграции знаний, эффективности выполнения и завершении задач анализа одноклеточных омиксных данных
Publication Details
Publication Date
2026-02-25
Journal
Publisher
ISSN
Cited by
0
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest