PaLM: Масштабирование языкового моделирования с помощью Pathways

PaLM: Scaling Language Modeling with Pathways
Noam Shazeer, Slav Petrov, Katherine Lee, Daphne Ippolito, Douglas Eck, Emily Reif, Aakanksha Chowdhery, Gaurav Mishra, James T. Bradbury, Sharan Narang, Henryk Michalewski, Andrew M. Dai, Orhan Fırat, Michael Isard, Érica Rodrigues Moreira, Jacob Austin, Xavier García, Thanumalayan Sankaranarayana Pillai, Jacob Devlin, Hyeontaek Lim, Shivani Agrawal, Joshua Maynez, Kevin Robinson, Sanjay Ghemawat, Marie Pellat, Vedant Misra, Pengcheng Yin, Charles Sutton, Xuezhi Wang, Anselm Levskaya, Mark Omernick, Zongwei Zhou, Brennan Saeta, Denny Zhou, Parker Schuh, Jason Lee, Yi Tay, Barret Zoph, Maarten Bosma, Jeff Dean, Sebastian Gehrmann, Adam Roberts, Paul Barham, Ryan Sepassi, Rewon Child, Hyung Won Chung, Michele Catasta, Ben Hutchinson, Parker Barnes, Vinodkumar Prabhakaran, Mark Díaz, Aitor Lewkowycz, Alexander Spiridonov, Kensen Shi, Sasha Tsvyashchenko, Abhishek S. Rao, Nan Du, Reiner Pope, Guy Gur-Ari, Toju Duke, Sunipa Dev, Liam Fedus, David Luan, D. Dohan, Oleksandr Polozov, Kathy Meier-Hellstern, Noah Fiedel, Wei, Jason, Meier-Hellstern, Kathy
2022-04-05

BIG-benchязыковая модель Pathwaysобучение по нескольким примераммногошаговое рассуждениемасштабирование языковых моделей
Показано, что большие языковые модели демонстрируют выдающиеся результаты в широком спектре задач обработки естественного языка при использовании обучения на небольшом числе примеров (few-shot learning), что значительно сокращает количество специализированных обучающих примеров, необходимых для адаптации модели к конкретному применению. Для дальнейшего изучения влияния масштаба на обучение на небольшом числе примеров мы обучили языковую модель Transformer с 540 миллиардами параметров и плотной активацией, которую назвали языковой моделью Pathways (PaLM). Мы обучали PaLM на 6144 чипах TPU v4 с использованием Pathways — новой системы машинного обучения, обеспечивающей высокоэффективное обучение на нескольких модулях TPU Pod. Мы демонстрируем сохраняющиеся преимущества масштабирования, получая передовые результаты в обучении на небольшом числе примеров по сотням тестов на понимание и генерацию языка. В ряде этих задач модель PaLM 540B демонстрирует прорывные результаты, превосходя современное состояние искусственно дообученных моделей в наборе задач, требующих многошагового рассуждения, и средний уровень человеческих результатов в недавно опубликованном тесте BIG-bench. В значительном числе задач BIG-bench наблюдалось скачкообразное улучшение при увеличении масштаба модели: результативность резко возрастала по мере перехода к нашей крупнейшей модели. PaLM также обладает высокими возможностями в многоязычных задачах и генерации исходного кода, что демонстрируется на широком наборе тестов. Кроме того, мы представляем всесторонний анализ предвзятости и токсичности и исследуем степень запоминания обучающих данных в зависимости от масштаба модели. Наконец, мы обсуждаем этические аспекты, связанные с большими языковыми моделями, а также потенциальные стратегии снижения соответствующих рисков.
1
На многих задачах BIG-bench наблюдались скачкообразные эффекты масштабирования: резкий рост качества проявлялся только у крупнейшей модели.
2
PaLM 540B превзошла дообученные системы передового уровня на нескольких задачах многошагового рассуждения и превысила средний человеческий результат на BIG-bench.
3
PaLM показала высокие результаты в многоязычных задачах и генерации исходного кода; также были исследованы смещения, токсичность, запоминание обучающих данных и стратегии этического снижения рисков.
4
PaLM представляет собой плотно активируемую трансформерную языковую модель с 540 миллиардами параметров, эффективно обученную на 6144 чипах TPU v4 с использованием системы Pathways.
5
Масштабирование PaLM обеспечило дальнейший рост качества few-shot-обучения и показало передовые результаты на сотнях тестов понимания и генерации языка.

языковая модель Pathways (PaLM) — плотно активируемая Transformer-модель с 540 миллиардами параметров

влияние масштаба модели на эффективность обучения по нескольким примерам, включая понимание и генерацию языка, рассуждение, многоязычные способности, генерацию кода, предвзятость, токсичность и запоминание обучающих данных

Publication Details
Publication Date
2022-04-05
Journal
Publisher
ISSN
Cited by
2136
Access Type
Author Information
Authors
Noam Shazeer
Slav Petrov
Katherine Lee
Daphne Ippolito
Douglas Eck
Emily Reif
Aakanksha Chowdhery
Gaurav Mishra
James T. Bradbury
Sharan Narang
Henryk Michalewski
Andrew M. Dai
Orhan Fırat
Michael Isard
Érica Rodrigues Moreira
Jacob Austin
Xavier García
Thanumalayan Sankaranarayana Pillai
Jacob Devlin
Hyeontaek Lim
Shivani Agrawal
Joshua Maynez
Kevin Robinson
Sanjay Ghemawat
Marie Pellat
Vedant Misra
Pengcheng Yin
Charles Sutton
Xuezhi Wang
Anselm Levskaya
Mark Omernick
Zongwei Zhou
Brennan Saeta
Denny Zhou
Parker Schuh
Jason Lee
Yi Tay
Barret Zoph
Maarten Bosma
Jeff Dean
Sebastian Gehrmann
Adam Roberts
Paul Barham
Ryan Sepassi
Rewon Child
Hyung Won Chung
Michele Catasta
Ben Hutchinson
Parker Barnes
Vinodkumar Prabhakaran
Mark Díaz
Aitor Lewkowycz
Alexander Spiridonov
Kensen Shi
Sasha Tsvyashchenko
Abhishek S. Rao
Nan Du
Reiner Pope
Guy Gur-Ari
Toju Duke
Sunipa Dev
Liam Fedus
David Luan
D. Dohan
Oleksandr Polozov
Kathy Meier-Hellstern
Noah Fiedel
Wei, Jason
Meier-Hellstern, Kathy
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%