Обучение языковых моделей следованию инструкциям с использованием обратной связи от человека

Training language models to follow instructions with human feedback
Sandhini Agarwal, Amanda Askell, Pamela Mishkin, Luke E. Miller, Peter Welinder, Chong Zhang, Jeff Wu, Jacob Hilton, Ryan Lowe, Jan Leike, Long Ouyang, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Katarina Slama, Alex Ray, John Schulman, Fraser Kelton, Maddie Simens, Paul Christiano
2022-03-04

InstructGPTобратная связь от человекаследование инструкциямвыравнивание языковых моделейобучение с подкреплением на основе обратной связи от человека
Увеличение размера языковых моделей само по себе не делает их более эффективными в следовании намерениям пользователя. Например, большие языковые модели могут генерировать недостоверные, токсичные или просто бесполезные для пользователя ответы. Иными словами, эти модели не согласованы с намерениями пользователей. В этой работе мы показываем возможность согласования языковых моделей с намерениями пользователей при выполнении широкого спектра задач посредством дообучения с использованием обратной связи от человека. Начав с набора подсказок, написанных разметчиками, и подсказок, отправленных через OpenAI API, мы собираем набор данных с демонстрациями желаемого поведения модели, подготовленными разметчиками, и используем его для дообучения GPT-3 методом обучения с учителем. Затем мы собираем набор данных с ранжированиями выходных данных модели и используем его для дальнейшего дообучения этой модели, обученной с учителем, методом обучения с подкреплением на основе обратной связи от человека. Полученные модели мы называем InstructGPT. В ходе оценивания людьми на распределении наших подсказок ответы модели InstructGPT с 1,3 млрд параметров получают предпочтение перед ответами GPT-3 со 175 млрд параметров, несмотря на наличие у первой модели в 100 раз меньшего числа параметров. Кроме того, модели InstructGPT демонстрируют повышение достоверности и снижение частоты генерации токсичных ответов при минимальном ухудшении результатов на общедоступных наборах данных по обработке естественного языка. Хотя InstructGPT по-прежнему допускает простые ошибки, наши результаты показывают, что дообучение с использованием обратной связи от человека является перспективным направлением для согласования языковых моделей с намерениями людей.
1
Дообучение языковых моделей с использованием обратной связи от людей обеспечивает подход к согласованию ответов с намерениями пользователей в широком спектре задач.
2
В оценках людей ответы InstructGPT с 1,3 млрд параметров предпочитались ответам GPT-3 с 175 млрд параметров, несмотря на в 100 раз меньшее число параметров.
3
InstructGPT повышает правдивость и снижает частоту токсичных ответов, сохраняя минимальное ухудшение результатов на общедоступных NLP-датасетах.
4
InstructGPT по-прежнему допускает простые ошибки, показывая, что дообучение с обратной связью людей улучшает согласованность, но не устраняет ошибки модели.
5
Сочетание обучения с учителем на демонстрациях разметчиков и последующего обучения с подкреплением на основе ранжирования ответов приводит к созданию моделей InstructGPT.

Языковые модели InstructGPT, дообученные с использованием обратной связи от людей

Согласование с намерениями пользователей, включая следование инструкциям, правдивость, токсичность, полезность и эффективность выполнения задач

Publication Details
Publication Date
2022-03-04
Journal
Publisher
ISSN
Cited by
4348
Access Type
Author Information
Authors
Sandhini Agarwal
Amanda Askell
Pamela Mishkin
Luke E. Miller
Peter Welinder
Chong Zhang
Jeff Wu
Jacob Hilton
Ryan Lowe
Jan Leike
Long Ouyang
Xu Jiang
Diogo Almeida
Carroll L. Wainwright
Katarina Slama
Alex Ray
John Schulman
Fraser Kelton
Maddie Simens
Paul Christiano
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%