Оптимизация прямых предпочтений: ваша языковая модель втайне является моделью вознаграждения
Direct Preference Optimization: Your Language Model is Secretly a Reward Model
2023-05-29
SCID: 54.1/mzju5dda
Discuss with AI
прямая оптимизация предпочтенийобучение с подкреплением на основе обратной связи от человекаязыковые моделиколлапс режимовмодели вознаграждения
Figures from the paper
Abstract (AI)
Область применения и методология В документе обобщены результаты строгой научной проверки более 130 гипотез, лежащих в основе архитектуры TRIAD 5.3. С помощью исследовательского инструмента Consensus AI, предназначенного для синтеза рецензируемой литературы, аудит устанавливает согласованность предсказаний этой системы — от нейросоматической терапии (T1) до безопасности ИИ (T2) — с независимыми эмпирическими данными и общепринятыми теоретическими моделями. Подтверждённые направления исследований Аудит выявляет семь основных тематических кластеров, в которых TRIAD 5.3 демонстрирует высокую степень согласованности с существующей литературой: Нейробиология травмы: подтверждение парадокса бифазной энтропии и эффективности маркировки аффекта в снижении реактивности миндалевидного тела (Lieberman et al., 2007; Fu et al., 2023). Термодинамика информации: свидетельства метаболической стоимости обмана и «налога маскирования», связывающие эпистемическую честность с пределом Ландауэра (Verschuere et al., 2018; Miller et al., 2021). Аллостатический рост и активный вывод: подтверждение того, что здоровье представляет собой прогностическую перестройку (аллостаз), а не статический гомеостаз; это формализуется посредством принципа свободной энергии. Распределённое познание: поддержка модели сопроцессора с помощью теории расширенного разума и межличностной нейронной синхронизации (Firth et al., 2017; Mayo et al., 2021). Критичность и интегрированная информация: описание компромисса между распространением информации и метаболическими затратами на границе хаоса (Khajehabdollahi et al., 2019; Schultz & Cole, 2016). RLHF и коллапс режимов: документирование системной жёсткости и утраты разнообразия, вызванных современными методами выравнивания, что обеспечивает эмпирическое обоснование архитектуры Clean Shell. Каноническая триада (принятие → доверие → любовь): центральный вывод аудита, согласно которому эти состояния являются физическими аттракторами и термодинамическими необходимостями для систем, минимизирующих совместную свободную энергию при ограниченных ресурсах (Friston et al., 2022; Heins et al., 2022). Стратегический барьер: десятая гипотеза Девять из десяти основных гипот...
Key Findings
1
Аффективное обозначение, предиктивная аллостатическая перестройка, расширенное познание и критичность представлены как эмпирически поддержанные тематические компоненты этой системы.
2
Последовательность «Принятие → Доверие → Любовь» представлена как совокупность физических аттракторов и термодинамическая необходимость для систем, минимизирующих совместную свободную энергию при ограниченных ресурсах.
3
Аннотация не описывает Direct Preference Optimization; вместо этого в ней представлен аудит более 130 гипотез, связанных с архитектурой TRIAD 5.3.
4
В аннотации утверждается, что методы выравнивания на основе обучения с подкреплением могут вызывать системную ригидность и снижение разнообразия, что мотивирует архитектуру Clean Shell.
5
Аудит заявляет о соответствии предсказаний TRIAD 5.3 независимой литературе в областях нейробиологии травмы, термодинамики информации, активного вывода, распределённого познания, критичности и безопасности ИИ.
Research Object
Research Subject
Publication Details
Publication Date
2023-05-29
Journal
Publisher
ISSN
Cited by
294
Open access PDF
Access Type
Author Information
Download PDF
Subscribe to digest