RLHF расшифровано: критический анализ обучения с подкреплением на основе человеческой обратной связи для крупных языковых моделей

RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
Karthik Narasimhan, Vishvak Murahari, Ameet Deshpande, Tanmay Rajpurohit, Ashwin Kalyan, Shreyas Chaudhari, Pranjal Aggarwal, Bruno Castro da Silva
2025-06-05

аппроксимация функцииневерная спецификация моделиобучение с подкреплением на основе человеческой обратной связимодель вознагражденияразреженная обратная связь
Существенной задачей при обучении крупных языковых моделей (LLM) в роли эффективных ассистентов является их выравнивание с человеческими предпочтениями. Обучение с подкреплением на основе человеческой обратной связи (RLHF) зарекомендовало себя как многообещающее решение. Однако наше понимание RLHF часто ограничено начальными проектными решениями. В этой статье RLHF анализируется через призму принципов обучения с подкреплением с акцентом на модель вознаграждения. Рассматриваются выборы моделирования и оговорки, связанные с аппроксимацией функций, выделяются предположения о выразительности вознаграждения и выявляются ограничения, такие как некорректная обобщаемость, неверная спецификация модели и разреженная обратная связь. Категориальный обзор текущей литературы даёт исследователям представление о проблемах RLHF и основания для развития существующих методов.
1
Категориальный обзор литературы консолидирует идеи и вызовы для направления будущих исследований и разработки методов RLHF.
2
Анализ RLHF через принципы обучения с подкреплением подчёркивает центральную роль и предположения обучаемой модели вознаграждения.
3
Распространённые выборы моделирования и аппроксимации функций вводят оговорки, включая неправильную обобщаемость и неправильную спецификацию модели.
4
RLHF широко используется для выравнивания LLM с человеческими предпочтениями, но понимание часто ограничено начальными проектными решениями.
5
Разреженная человеческая обратная связь выявлена как ограничение, мешающее точному обучению вознаграждения для выравнивания LLM.

Метод обучения с подкреплением на основе человеческой обратной связи (RLHF), применённый к большим языковым моделям (LLM)

Модель вознаграждения и связанные с ней выборы моделирования, оговорки аппроксимации функций, предположения о выразительности вознаграждения и вытекающие ограничения (ошибочная генерализация, неправильная спецификация модели, разреженная обратная связь), влияющие на согласование LLM с человеческими предпочтениями

Publication Details
Publication Date
2025-06-05
Journal
Publisher
ISSN
Cited by
69
Access Type
Author Information
Authors
Karthik Narasimhan
Vishvak Murahari
Ameet Deshpande
Tanmay Rajpurohit
Ashwin Kalyan
Shreyas Chaudhari
Pranjal Aggarwal
Bruno Castro da Silva
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%