Затерянные в середине: как языковые модели используют длинные контексты
Lost in the Middle: How Language Models Use Long Contexts
2024-01-01
SCID: 54.1/mh3r4y94
Discuss with AI
извлечение по ключу-значениюоценка длинного контекстаязыковые модели с длинным контекстомвопросно-ответная система по нескольким документамзависимость производительности от позиции
Figures from the paper
Abstract (AI)
Хотя современные языковые модели способны принимать на вход длинные контексты, относительно мало известно о том, насколько эффективно они используют контексты большой длины. Мы анализируем эффективность языковых моделей в выполнении двух задач, требующих выявления релевантной информации во входных контекстах: ответов на вопросы по нескольким документам и поиска по ключу и значению. Мы обнаружили, что эффективность может значительно снижаться при изменении положения релевантной информации, что указывает на неспособность современных языковых моделей надежно использовать информацию в длинных входных контекстах. В частности, мы наблюдаем, что эффективность часто максимальна, когда релевантная информация находится в начале или в конце входного контекста, и значительно снижается, когда модели должны обращаться к релевантной информации в середине длинных контекстов, даже если речь идет о моделях, специально разработанных для работы с длинными контекстами. Наш анализ позволяет лучше понять, как языковые модели используют входной контекст, и предлагает новые протоколы оценки для будущих языковых моделей, работающих с длинными контекстами.
Key Findings
1
Доступ к релевантной информации в середине длинного контекста вызывает значительное падение производительности, включая модели, специально разработанные для длинных контекстов.
2
Производительность моделей может существенно снижаться при изменении положения релевантной информации во входном контексте.
3
Модели обычно работают лучше всего, когда релевантная информация находится в начале или конце длинного контекста.
4
Предложенный анализ предоставляет протоколы оценки устойчивости использования длинных входных контекстов будущими языковыми моделями.
5
Исследование оценивает языковые модели с длинным контекстом на задачах ответов на вопросы по нескольким документам и извлечения значений по ключам.
Research Object
языковые модели, обрабатывающие длинные входные контексты
Research Subject
зависимость извлечения релевантной информации и эффективности выполнения задач от положения информации в длинном контексте, включая снижение эффективности при размещении информации в его середине
Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
1281
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest