RLHF расшифровано: критический анализ обучения с подкреплением на основе человеческой обратной связи для крупных языковых моделей
RLHF Deciphered: A Critical Analysis of Reinforcement Learning from Human Feedback for LLMs
2025-06-05
SCID: 54.1/bbgng82z
Discuss with AI
аппроксимация функцииневерная спецификация моделиобучение с подкреплением на основе человеческой обратной связимодель вознагражденияразреженная обратная связь
Figures from the paper
Abstract (AI)
Существенной задачей при обучении крупных языковых моделей (LLM) в роли эффективных ассистентов является их выравнивание с человеческими предпочтениями. Обучение с подкреплением на основе человеческой обратной связи (RLHF) зарекомендовало себя как многообещающее решение. Однако наше понимание RLHF часто ограничено начальными проектными решениями. В этой статье RLHF анализируется через призму принципов обучения с подкреплением с акцентом на модель вознаграждения. Рассматриваются выборы моделирования и оговорки, связанные с аппроксимацией функций, выделяются предположения о выразительности вознаграждения и выявляются ограничения, такие как некорректная обобщаемость, неверная спецификация модели и разреженная обратная связь. Категориальный обзор текущей литературы даёт исследователям представление о проблемах RLHF и основания для развития существующих методов.
Key Findings
1
Категориальный обзор литературы консолидирует идеи и вызовы для направления будущих исследований и разработки методов RLHF.
2
Анализ RLHF через принципы обучения с подкреплением подчёркивает центральную роль и предположения обучаемой модели вознаграждения.
3
Распространённые выборы моделирования и аппроксимации функций вводят оговорки, включая неправильную обобщаемость и неправильную спецификацию модели.
4
RLHF широко используется для выравнивания LLM с человеческими предпочтениями, но понимание часто ограничено начальными проектными решениями.
5
Разреженная человеческая обратная связь выявлена как ограничение, мешающее точному обучению вознаграждения для выравнивания LLM.
Research Object
Метод обучения с подкреплением на основе человеческой обратной связи (RLHF), применённый к большим языковым моделям (LLM)
Research Subject
Модель вознаграждения и связанные с ней выборы моделирования, оговорки аппроксимации функций, предположения о выразительности вознаграждения и вытекающие ограничения (ошибочная генерализация, неправильная спецификация модели, разреженная обратная связь), влияющие на согласование LLM с человеческими предпочтениями
Publication Details
Publication Date
2025-06-05
Journal
Publisher
ISSN
Cited by
69
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest