Обзор современных тенденций, методов и проблем больших языковых моделей (LLM)
A Review of Current Trends, Techniques, and Challenges in Large Language Models (LLMs)
2024-03-01
SCID: 54.1/kqhr6mqj
Discuss with AI
бенчмаркидообучение (fine-tuning)обучение в контексте (in-context learning)большие языковые модели (LLMs)порождение естественного языка (NLG)понимание естественного языка (NLU)цели предобучениямасштабируемость (глубина, ширина, размер данных)самообучающееся предобучениепереносное обучение
Figures from the paper
Abstract (AI)
Обработка естественного языка (NLP) значительно преобразилась за последнее десятилетие, особенно в области моделирования языка. Большие языковые модели (LLM) достигли передовых результатов в задачах понимания естественного языка (NLU) и генерации естественного языка (NLG), обучая представления языка в самообучающемся режиме. В этой статье представлен всесторонний обзор, отражающий развитие достижений в области языковых моделей. Мы рассматриваем разные аспекты языковых моделей, которые изначально имели несколько миллионов параметров, но в очень короткие сроки достигли порядка триллиона параметров. Также мы анализируем, как эти LLM эволюционировали от специфичных для задач архитектур к независимым от задач и далее к архитектурам, независимым от задач и языков. В статье подробно обсуждаются различные цели предварительного обучения, бенчмарки и методы трансферного обучения, используемые в LLM, а также рассматриваются методы дообучения (finetuning) и in-context обучения, применяемые для задач нижнего уровня. Более того, мы исследуем, как LLM способны хорошо работать в различных доменах и на разных наборах данных при достаточном обучении на больших и разнообразных данных. Далее обсуждается, как с течением времени доступность дешёвой вычислительной мощности и больших датасетов улучшила возможности LLM и породила новые проблемы. В рамках исследования мы также рассматриваем масштабируемость LLM, чтобы понять, как на производительность влияют глубина модели, ширина и объём данных. Наконец, мы приводим эмпирическое сравнение существующих тенденций и методов и даём всесторонний анализ текущего состояния области LLM.
Key Findings
1
Различные цели предобучения, бенчмарки и методы переноса являются ключевыми для производительности LLM; дообучение и обучение в контексте критичны для downstream-задач.
2
Рост доступной вычислительной мощности и крупных датасетов улучшил возможности LLM, но одновременно породил новые проблемы; производительность моделей масштабируется с глубиной, шириной и размером данных.
3
LLM быстро выросли от миллионов до триллионов параметров и стали SOTA в задачах NLU и NLG благодаря самосупервизированному обучению представлений.
4
Архитектуры языковых моделей эволюционировали от специализированных для задач к независимым от задач, а затем к независимым от задач и языка.
5
Достаточное обучение на больших и разнообразных наборах данных позволяет LLM хорошо работать в различных доменах и на разных датасетах.
Research Object
Большие языковые модели (LLMs)
Research Subject
Актуальные тенденции и техники, масштабируемость, цели предобучения, методы дообучения и обучения в контексте, бенчмарки, трансферное обучение, производительность по доменам/обобщаемость и проблемы при разработке и внедрении LLM
Publication Details
Publication Date
2024-03-01
Journal
Publisher
ISSN
Cited by
241
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest