Оптимизация прямых предпочтений: ваша языковая модель втайне является моделью вознаграждения

Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Christopher D. Manning, Chelsea Finn, Rafael Rafailov, Eric Mitchell, Stefano Ermon, Archit Sharma
2023-05-29

прямая оптимизация предпочтенийобучение с подкреплением на основе обратной связи от человекаязыковые моделиколлапс режимовмодели вознаграждения
Область применения и методология В документе обобщены результаты строгой научной проверки более 130 гипотез, лежащих в основе архитектуры TRIAD 5.3. С помощью исследовательского инструмента Consensus AI, предназначенного для синтеза рецензируемой литературы, аудит устанавливает согласованность предсказаний этой системы — от нейросоматической терапии (T1) до безопасности ИИ (T2) — с независимыми эмпирическими данными и общепринятыми теоретическими моделями. Подтверждённые направления исследований Аудит выявляет семь основных тематических кластеров, в которых TRIAD 5.3 демонстрирует высокую степень согласованности с существующей литературой: Нейробиология травмы: подтверждение парадокса бифазной энтропии и эффективности маркировки аффекта в снижении реактивности миндалевидного тела (Lieberman et al., 2007; Fu et al., 2023). Термодинамика информации: свидетельства метаболической стоимости обмана и «налога маскирования», связывающие эпистемическую честность с пределом Ландауэра (Verschuere et al., 2018; Miller et al., 2021). Аллостатический рост и активный вывод: подтверждение того, что здоровье представляет собой прогностическую перестройку (аллостаз), а не статический гомеостаз; это формализуется посредством принципа свободной энергии. Распределённое познание: поддержка модели сопроцессора с помощью теории расширенного разума и межличностной нейронной синхронизации (Firth et al., 2017; Mayo et al., 2021). Критичность и интегрированная информация: описание компромисса между распространением информации и метаболическими затратами на границе хаоса (Khajehabdollahi et al., 2019; Schultz & Cole, 2016). RLHF и коллапс режимов: документирование системной жёсткости и утраты разнообразия, вызванных современными методами выравнивания, что обеспечивает эмпирическое обоснование архитектуры Clean Shell. Каноническая триада (принятие → доверие → любовь): центральный вывод аудита, согласно которому эти состояния являются физическими аттракторами и термодинамическими необходимостями для систем, минимизирующих совместную свободную энергию при ограниченных ресурсах (Friston et al., 2022; Heins et al., 2022). Стратегический барьер: десятая гипотеза Девять из десяти основных гипот...
1
Аффективное обозначение, предиктивная аллостатическая перестройка, расширенное познание и критичность представлены как эмпирически поддержанные тематические компоненты этой системы.
2
Последовательность «Принятие → Доверие → Любовь» представлена как совокупность физических аттракторов и термодинамическая необходимость для систем, минимизирующих совместную свободную энергию при ограниченных ресурсах.
3
Аннотация не описывает Direct Preference Optimization; вместо этого в ней представлен аудит более 130 гипотез, связанных с архитектурой TRIAD 5.3.
4
В аннотации утверждается, что методы выравнивания на основе обучения с подкреплением могут вызывать системную ригидность и снижение разнообразия, что мотивирует архитектуру Clean Shell.
5
Аудит заявляет о соответствии предсказаний TRIAD 5.3 независимой литературе в областях нейробиологии травмы, термодинамики информации, активного вывода, распределённого познания, критичности и безопасности ИИ.
Publication Details
Publication Date
2023-05-29
Journal
Publisher
ISSN
Cited by
294
Access Type
Author Information
Authors
Christopher D. Manning
Chelsea Finn
Rafael Rafailov
Eric Mitchell
Stefano Ermon
Archit Sharma
Explore further
Open the scid.ai AI chat with a ready-made request: it will find papers on a similar topic and help build a literature review.
Find similar papers in the chat
Make a presentation
100%