Обзор современных тенденций, методов и проблем больших языковых моделей (LLM)

A Review of Current Trends, Techniques, and Challenges in Large Language Models (LLMs)
Rajvardhan Patil, Venkat N. Gudivada
2024-03-01

бенчмаркидообучение (fine-tuning)обучение в контексте (in-context learning)большие языковые модели (LLMs)порождение естественного языка (NLG)понимание естественного языка (NLU)цели предобучениямасштабируемость (глубина, ширина, размер данных)самообучающееся предобучениепереносное обучение
Обработка естественного языка (NLP) значительно преобразилась за последнее десятилетие, особенно в области моделирования языка. Большие языковые модели (LLM) достигли передовых результатов в задачах понимания естественного языка (NLU) и генерации естественного языка (NLG), обучая представления языка в самообучающемся режиме. В этой статье представлен всесторонний обзор, отражающий развитие достижений в области языковых моделей. Мы рассматриваем разные аспекты языковых моделей, которые изначально имели несколько миллионов параметров, но в очень короткие сроки достигли порядка триллиона параметров. Также мы анализируем, как эти LLM эволюционировали от специфичных для задач архитектур к независимым от задач и далее к архитектурам, независимым от задач и языков. В статье подробно обсуждаются различные цели предварительного обучения, бенчмарки и методы трансферного обучения, используемые в LLM, а также рассматриваются методы дообучения (finetuning) и in-context обучения, применяемые для задач нижнего уровня. Более того, мы исследуем, как LLM способны хорошо работать в различных доменах и на разных наборах данных при достаточном обучении на больших и разнообразных данных. Далее обсуждается, как с течением времени доступность дешёвой вычислительной мощности и больших датасетов улучшила возможности LLM и породила новые проблемы. В рамках исследования мы также рассматриваем масштабируемость LLM, чтобы понять, как на производительность влияют глубина модели, ширина и объём данных. Наконец, мы приводим эмпирическое сравнение существующих тенденций и методов и даём всесторонний анализ текущего состояния области LLM.
1
Различные цели предобучения, бенчмарки и методы переноса являются ключевыми для производительности LLM; дообучение и обучение в контексте критичны для downstream-задач.
2
Рост доступной вычислительной мощности и крупных датасетов улучшил возможности LLM, но одновременно породил новые проблемы; производительность моделей масштабируется с глубиной, шириной и размером данных.
3
LLM быстро выросли от миллионов до триллионов параметров и стали SOTA в задачах NLU и NLG благодаря самосупервизированному обучению представлений.
4
Архитектуры языковых моделей эволюционировали от специализированных для задач к независимым от задач, а затем к независимым от задач и языка.
5
Достаточное обучение на больших и разнообразных наборах данных позволяет LLM хорошо работать в различных доменах и на разных датасетах.

Большие языковые модели (LLMs)

Актуальные тенденции и техники, масштабируемость, цели предобучения, методы дообучения и обучения в контексте, бенчмарки, трансферное обучение, производительность по доменам/обобщаемость и проблемы при разработке и внедрении LLM

Publication Details
Publication Date
2024-03-01
Journal
Publisher
ISSN
Cited by
241
Access Type
Author Information
Authors
Rajvardhan Patil
Venkat N. Gudivada
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%