Tag: alignment-rlhf
-
【AI 核心深度 M5-037】解释奖励模型的泛化与过优化(over-optimization)。(Reward Model Generalization and Over-Optimization)深度数理推导与工程落地解析
RM 只在偏好数据分布上可靠;策略越优化越会进入 RM 的分布外区域,导致奖励升而真实质量降(Goodhart)。
-
【AI 核心深度 M5-038】解释 RLHF 的 on-policy 采样与 off-policy 数据。(On-Policy Sampling vs. Off-Policy Data in RLHF)深度数理推导与工程落地解析
PPO 需 on-policy 采样(当前策略生成)保证重要性采样正确;RM 训练常用 off-policy 数据;迭代式 RLHF 混合两者。
-
【AI 核心深度 M5-039】解释 PPO 在 LLM 中的实现细节(token-level vs sequence-level)。(PPO Implementation Nuances in LLMs: Token-Level vs. Sequence-Level)深度数理推导与工程落地解析
动作是 token 但奖励是序列级;实现上 ratio 与 KL 按 token 算、优势广播到 token;只对回答 token 算损失。
-
【AI 核心深度 M5-040】解释迭代式 RLHF / online RLHF 的动机与做法。(Motivations and Practices of Iterative / Online RLHF)深度数理推导与工程落地解析
单轮 RLHF 会因 RM 过优化而退化;迭代式定期用新策略输出重新标注、更新 RM,缩小分布外区域。
-
【AI 核心深度 M5-041】解释 Constitutional AI 与 RLAIF。(Constitutional AI and RLAIF (Reinforcement Learning from AI Feedback))深度数理推导与工程落地解析
CAI 用’宪法’(原则清单)让模型自我批评与修订,再由 AI 依宪法标注偏好;RLAIF 用 AI 反馈替代人工。
-
【AI 核心深度 M5-030】描述 RLHF 的三阶段流程。(The Three-Stage RLHF Pipeline)深度数理推导与工程落地解析
① SFT 得到初始策略;② 用人类偏好比较训练奖励模型;③ 用 PPO 在奖励模型上优化策略(带 KL 约束)。
-
【AI 核心深度 M5-031】写出 Bradley-Terry 偏好模型与奖励模型损失。(Bradley-Terry Preference Model and Reward Model Loss Formulation)深度数理推导与工程落地解析
BT 模型假设 P(y_w≻y_l)=σ(r(y_w)−r(y_l));用该似然训练奖励模型,即 pairwiselogistic 损失。
-
【AI 核心深度 M5-032】写出 PPO 的裁剪目标,并解释 min 与 clip 的作用。(PPO Clipped Surrogate Objective and the Rationale for Min and Clip)深度数理推导与工程落地解析
目标为 min(ratio·A, clip(ratio,1−ε,1+ε)·A);clip 限制单步策略变化,min 取保守下界,保证不过度更新。
-
【AI 核心深度 M5-033】解释 GAE 与优势估计在 RLHF 中的作用。(Generalized Advantage Estimation (GAE) and Advantage in RLHF)深度数理推导与工程落地解析
GAE 用 TD 残差的指数加权和估计优势,平衡偏差与方差;优势函数决定’该动作比平均好多少’。
-
【AI 核心深度 M5-034】解释奖励黑客(reward hacking)与缓解手段。(Reward Hacking and Mitigation Strategies in RLHF)深度数理推导与工程落地解析
策略钻奖励模型的空子(如冗长、谄媚、格式取巧),奖励升而真实质量降;用 KL 约束、集成、迭代更新、规则过滤缓解。