Обучение языковых моделей следованию инструкциям с использованием обратной связи от человека
Training language models to follow instructions with human feedback
2022-03-04
SCID: 54.1/8uddase2
Discuss with AI
InstructGPTобратная связь от человекаследование инструкциямвыравнивание языковых моделейобучение с подкреплением на основе обратной связи от человека
Figures from the paper
Abstract (AI)
Увеличение размера языковых моделей само по себе не делает их более эффективными в следовании намерениям пользователя. Например, большие языковые модели могут генерировать недостоверные, токсичные или просто бесполезные для пользователя ответы. Иными словами, эти модели не согласованы с намерениями пользователей. В этой работе мы показываем возможность согласования языковых моделей с намерениями пользователей при выполнении широкого спектра задач посредством дообучения с использованием обратной связи от человека. Начав с набора подсказок, написанных разметчиками, и подсказок, отправленных через OpenAI API, мы собираем набор данных с демонстрациями желаемого поведения модели, подготовленными разметчиками, и используем его для дообучения GPT-3 методом обучения с учителем. Затем мы собираем набор данных с ранжированиями выходных данных модели и используем его для дальнейшего дообучения этой модели, обученной с учителем, методом обучения с подкреплением на основе обратной связи от человека. Полученные модели мы называем InstructGPT. В ходе оценивания людьми на распределении наших подсказок ответы модели InstructGPT с 1,3 млрд параметров получают предпочтение перед ответами GPT-3 со 175 млрд параметров, несмотря на наличие у первой модели в 100 раз меньшего числа параметров. Кроме того, модели InstructGPT демонстрируют повышение достоверности и снижение частоты генерации токсичных ответов при минимальном ухудшении результатов на общедоступных наборах данных по обработке естественного языка. Хотя InstructGPT по-прежнему допускает простые ошибки, наши результаты показывают, что дообучение с использованием обратной связи от человека является перспективным направлением для согласования языковых моделей с намерениями людей.
Key Findings
1
Дообучение языковых моделей с использованием обратной связи от людей обеспечивает подход к согласованию ответов с намерениями пользователей в широком спектре задач.
2
В оценках людей ответы InstructGPT с 1,3 млрд параметров предпочитались ответам GPT-3 с 175 млрд параметров, несмотря на в 100 раз меньшее число параметров.
3
InstructGPT повышает правдивость и снижает частоту токсичных ответов, сохраняя минимальное ухудшение результатов на общедоступных NLP-датасетах.
4
InstructGPT по-прежнему допускает простые ошибки, показывая, что дообучение с обратной связью людей улучшает согласованность, но не устраняет ошибки модели.
5
Сочетание обучения с учителем на демонстрациях разметчиков и последующего обучения с подкреплением на основе ранжирования ответов приводит к созданию моделей InstructGPT.
Research Object
Языковые модели InstructGPT, дообученные с использованием обратной связи от людей
Research Subject
Согласование с намерениями пользователей, включая следование инструкциям, правдивость, токсичность, полезность и эффективность выполнения задач
Publication Details
Publication Date
2022-03-04
Journal
Publisher
ISSN
Cited by
4348
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest
Работы, цитирующие эту статью8
Обзор безопасности и конфиденциальности больших языковых моделей (LLM): Хорошее, Плохое и Уродливое2024
Большие языковые модели для программной инженерии: систематический обзор литературы2024
Управление человеческими ресурсами в эпоху генеративного искусственного интеллекта: перспективы и направления исследований ChatGPT2023
Генеративный искусственный интеллект2023
Активная генерация с дополнением посредством поиска2023
Искусственный интеллект для приложений предиктивного обслуживания: ключевые компоненты, доверие и будущие тенденции2024
AI-агенты под угрозой: обзор ключевых проблем безопасности и перспективных направлений2025
Интерактивная компьютерная поддержка диагностики медицинских изображений с использованием крупных языковых моделей2024