PaLM: Масштабирование языкового моделирования с помощью Pathways
PaLM: Scaling Language Modeling with Pathways
2022-04-05
SCID: 54.1/tzn3x73m
Discuss with AI
BIG-benchязыковая модель Pathwaysобучение по нескольким примераммногошаговое рассуждениемасштабирование языковых моделей
Figures from the paper
Abstract (AI)
Показано, что большие языковые модели демонстрируют выдающиеся результаты в широком спектре задач обработки естественного языка при использовании обучения на небольшом числе примеров (few-shot learning), что значительно сокращает количество специализированных обучающих примеров, необходимых для адаптации модели к конкретному применению. Для дальнейшего изучения влияния масштаба на обучение на небольшом числе примеров мы обучили языковую модель Transformer с 540 миллиардами параметров и плотной активацией, которую назвали языковой моделью Pathways (PaLM). Мы обучали PaLM на 6144 чипах TPU v4 с использованием Pathways — новой системы машинного обучения, обеспечивающей высокоэффективное обучение на нескольких модулях TPU Pod. Мы демонстрируем сохраняющиеся преимущества масштабирования, получая передовые результаты в обучении на небольшом числе примеров по сотням тестов на понимание и генерацию языка. В ряде этих задач модель PaLM 540B демонстрирует прорывные результаты, превосходя современное состояние искусственно дообученных моделей в наборе задач, требующих многошагового рассуждения, и средний уровень человеческих результатов в недавно опубликованном тесте BIG-bench. В значительном числе задач BIG-bench наблюдалось скачкообразное улучшение при увеличении масштаба модели: результативность резко возрастала по мере перехода к нашей крупнейшей модели. PaLM также обладает высокими возможностями в многоязычных задачах и генерации исходного кода, что демонстрируется на широком наборе тестов. Кроме того, мы представляем всесторонний анализ предвзятости и токсичности и исследуем степень запоминания обучающих данных в зависимости от масштаба модели. Наконец, мы обсуждаем этические аспекты, связанные с большими языковыми моделями, а также потенциальные стратегии снижения соответствующих рисков.
Key Findings
1
На многих задачах BIG-bench наблюдались скачкообразные эффекты масштабирования: резкий рост качества проявлялся только у крупнейшей модели.
2
PaLM 540B превзошла дообученные системы передового уровня на нескольких задачах многошагового рассуждения и превысила средний человеческий результат на BIG-bench.
3
PaLM показала высокие результаты в многоязычных задачах и генерации исходного кода; также были исследованы смещения, токсичность, запоминание обучающих данных и стратегии этического снижения рисков.
4
PaLM представляет собой плотно активируемую трансформерную языковую модель с 540 миллиардами параметров, эффективно обученную на 6144 чипах TPU v4 с использованием системы Pathways.
5
Масштабирование PaLM обеспечило дальнейший рост качества few-shot-обучения и показало передовые результаты на сотнях тестов понимания и генерации языка.
Research Object
языковая модель Pathways (PaLM) — плотно активируемая Transformer-модель с 540 миллиардами параметров
Research Subject
влияние масштаба модели на эффективность обучения по нескольким примерам, включая понимание и генерацию языка, рассуждение, многоязычные способности, генерацию кода, предвзятость, токсичность и запоминание обучающих данных
Publication Details
Publication Date
2022-04-05
Journal
Publisher
ISSN
Cited by
2136
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest