Бенчмаркинг агентов на основе больших языковых моделей для анализа одноклеточных омиксных данных

Benchmarking LLM-based agents for single-cell omics analysis
Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li
2026-02-25

агенты на основе больших языковых моделейсистема бенчмаркинговой оценкимультиагентные фреймворкигенерация с дополнением поискаанализ одноклеточной омики
ПРЕДПОСЫЛКИ: Стремительный рост объёма одноклеточных омиксных данных выявляет ограничения традиционных рабочих процессов анализа, основанных на ручном определении процедур. Агенты искусственного интеллекта предлагают смену парадигмы, обеспечивая адаптивное планирование, генерацию исполняемого кода, прослеживаемость решений и объединение знаний в реальном времени. Однако отсутствие комплексного бенчмарка существенно препятствует прогрессу. РЕЗУЛЬТАТЫ: Мы представляем новую систему бенчмаркинговой оценки для строгого анализа возможностей агентов в исследовании одноклеточных омиксных данных. Система включает унифицированную платформу, совместимую с различными фреймворками агентов и большими языковыми моделями (LLM); многомерные метрики для оценки синтеза когнитивных программ, взаимодействия, эффективности выполнения, интеграции биоинформатических знаний и качества выполнения задач; а также 50 разнообразных реальных задач анализа одноклеточных омиксных данных, охватывающих мультиомиксные исследования, различные виды и технологии секвенирования. Наша оценка показывает, что Grok3-beta достигает передовых результатов среди протестированных фреймворков агентов. Мультиагентные фреймворки значительно повышают эффективность взаимодействия и выполнения по сравнению с одноагентными подходами благодаря распределению специализированных ролей. Анализ вклада различных возможностей агентов показывает, что генерация высококачественного кода имеет решающее значение для успешного выполнения задач, а саморефлексия оказывает наиболее значимое общее влияние, за которой следуют генерация с дополнением поиска (RAG) и планирование. ВЫВОДЫ: Работа выявляет сохраняющиеся проблемы генерации кода, обработки длинных контекстов и контекстно-зависимого поиска знаний, создавая важную эмпирическую основу и формулируя передовые практики для разработки надёжных агентов искусственного интеллекта в вычислительной биологии.
1
Среди оценённых агентных фреймворков Grok3-beta продемонстрировал наилучшие результаты.
2
Высококачественная генерация кода критически важна для успешного выполнения задач, а саморефлексия оказывает наибольшее общее влияние, за ней следуют retrieval-augmented generation и планирование; сохраняются проблемы обработки длинного контекста и контекстно-зависимого поиска знаний.
3
Представлен унифицированный бенчмарк для оценки агентов на основе больших языковых моделей в анализе одноклеточной омики, совместимый с различными агентными фреймворками и языковыми моделями.
4
Мультиагентные системы повышают качество взаимодействия и эффективность выполнения по сравнению с одноагентными подходами благодаря разделению специализированных ролей.
5
Бенчмарк использует многомерные метрики и включает 50 реальных задач, охватывающих мультиомику, разные виды и технологии секвенирования.

ИИ-агенты на основе больших языковых моделей (LLM) для анализа одноклеточных омиксных данных

Способности и производительность агентов при планировании, генерации кода, совместной работе, интеграции знаний, эффективности выполнения и завершении задач анализа одноклеточных омиксных данных

Publication Details
Publication Date
2026-02-25
Journal
Publisher
ISSN
Cited by
0
Access Type
Author Information
Authors
Yang Liu
Lu Zhou
Xiawei Du
Ruikun He
Xuguang Zhang
Rongbo Shen
Yixue Li
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%