За пределами игры в имитацию: количественная оценка и экстраполяция возможностей языковых моделей
Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models
2022-06-09
SCID: 54.1/6nnyfxpw
Discuss with AI
бенчмарк BIG-benchспособности языковых моделейзаконы масштабированиясоциальная предвзятостьразреженные трансформеры
Figures from the paper
Abstract (AI)
С увеличением масштаба языковые модели демонстрируют как количественное улучшение, так и новые качественные возможности. Несмотря на потенциально преобразующее воздействие этих возможностей, в настоящее время они остаются недостаточно изученными. Для определения направлений будущих исследований, подготовки к появлению новых дестабилизирующих возможностей моделей и смягчения социально вредных последствий крайне важно понять текущие и ближайшие перспективные возможности и ограничения языковых моделей. Для решения этой задачи мы представляем бенчмарк Beyond the Imitation Game (BIG-bench). В настоящее время BIG-bench включает 204 задания, предложенных 450 авторами из 132 учреждений. Тематика заданий разнообразна и охватывает задачи из области лингвистики, развития в детском возрасте, математики, рассуждений на основе здравого смысла, биологии, физики, социальных предубеждений, разработки программного обеспечения и других областей. BIG-bench ориентирован на задания, которые, как предполагается, выходят за пределы возможностей современных языковых моделей. Мы оцениваем поведение моделей GPT компании OpenAI, плотных трансформерных архитектур, разработанных внутри Google, и разреженных трансформеров типа Switch на BIG-bench, используя модели размером от миллионов до сотен миллиардов параметров. Кроме того, команда экспертов-оценщиков выполнила все задания, чтобы обеспечить надежную базовую линию сравнения. Основные результаты таковы: с увеличением масштаба улучшаются как производительность моделей, так и их калибровка, однако в абсолютном выражении они остаются низкими (как и по сравнению с результатами оценщиков); производительность Remarkably similar across model classes, хотя разреженность дает преимущества; задания, в которых показатели улучшаются постепенно и предсказуемо, обычно содержат значительный компонент, связанный со знаниями или запоминанием, тогда как задания, демонстрирующие «прорывное» поведение при достижении критического масштаба, часто включают несколько этапов или компонентов либо используют хрупкие метрики; социальная предвзятость обычно усиливается с увеличением масштаба в условиях неоднозначного контекста, однако ее можно уменьшить с помощью промптинга.
Key Findings
1
Для моделей размером от миллионов до сотен миллиардов параметров производительность и калибровка обычно улучшаются с масштабированием, но остаются низкими по сравнению с экспертами-оценщиками.
2
BIG-bench включает 204 разнообразные задачи, созданные 450 авторами из 132 учреждений, для оценки новых и сложных способностей языковых моделей.
3
Постепенное и предсказуемое масштабирование характерно для задач, основанных на знаниях или запоминании, тогда как прорывы при критическом масштабе часто связаны с многошаговым рассуждением, несколькими компонентами или хрупкими метриками.
4
Производительность разных классов моделей, включая плотные и разреженные архитектуры, remarkably схожа, хотя разреженность даёт измеримые преимущества.
5
Социальная предвзятость обычно усиливается с масштабированием в условиях неоднозначного контекста, но этот эффект можно уменьшить с помощью промптинга.
Research Object
языковые модели, включая плотные и разреженные трансформерные архитектуры, оцениваемые в диапазоне масштабов
Research Subject
их способности, ограничения, зависимость характеристик от масштаба, калибровка, скачкообразное улучшение результатов и социальная предвзятость при выполнении разнообразных задач
Publication Details
Publication Date
2022-06-09
Journal
Publisher
ISSN
Cited by
565
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest