Затерянные в середине: как языковые модели используют длинные контексты

Lost in the Middle: How Language Models Use Long Contexts
Kevin Lin, Percy Liang, John Hewitt, Fabio Petroni, Nelson F. Liu, Ashwin Paranjape, Michele Bevilacqua
2024-01-01

извлечение по ключу-значениюоценка длинного контекстаязыковые модели с длинным контекстомвопросно-ответная система по нескольким документамзависимость производительности от позиции
Хотя современные языковые модели способны принимать на вход длинные контексты, относительно мало известно о том, насколько эффективно они используют контексты большой длины. Мы анализируем эффективность языковых моделей в выполнении двух задач, требующих выявления релевантной информации во входных контекстах: ответов на вопросы по нескольким документам и поиска по ключу и значению. Мы обнаружили, что эффективность может значительно снижаться при изменении положения релевантной информации, что указывает на неспособность современных языковых моделей надежно использовать информацию в длинных входных контекстах. В частности, мы наблюдаем, что эффективность часто максимальна, когда релевантная информация находится в начале или в конце входного контекста, и значительно снижается, когда модели должны обращаться к релевантной информации в середине длинных контекстов, даже если речь идет о моделях, специально разработанных для работы с длинными контекстами. Наш анализ позволяет лучше понять, как языковые модели используют входной контекст, и предлагает новые протоколы оценки для будущих языковых моделей, работающих с длинными контекстами.
1
Доступ к релевантной информации в середине длинного контекста вызывает значительное падение производительности, включая модели, специально разработанные для длинных контекстов.
2
Производительность моделей может существенно снижаться при изменении положения релевантной информации во входном контексте.
3
Модели обычно работают лучше всего, когда релевантная информация находится в начале или конце длинного контекста.
4
Предложенный анализ предоставляет протоколы оценки устойчивости использования длинных входных контекстов будущими языковыми моделями.
5
Исследование оценивает языковые модели с длинным контекстом на задачах ответов на вопросы по нескольким документам и извлечения значений по ключам.

языковые модели, обрабатывающие длинные входные контексты

зависимость извлечения релевантной информации и эффективности выполнения задач от положения информации в длинном контексте, включая снижение эффективности при размещении информации в его середине

Publication Details
Publication Date
2024-01-01
Journal
Publisher
ISSN
Cited by
1281
Access Type
Author Information
Authors
Kevin Lin
Percy Liang
John Hewitt
Fabio Petroni
Nelson F. Liu
Ashwin Paranjape
Michele Bevilacqua
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%