Tag: module-m5
-
【AI 核心深度 M5-041】解释 Constitutional AI 与 RLAIF。(Constitutional AI and RLAIF (Reinforcement Learning from AI Feedback))深度数理推导与工程落地解析
CAI 用’宪法’(原则清单)让模型自我批评与修订,再由 AI 依宪法标注偏好;RLAIF 用 AI 反馈替代人工。
-
【AI 核心深度 M5-042】完整推导 DPO 损失。(Full Mathematical Derivation of Direct Preference Optimization (DPO) Loss)深度数理推导与工程落地解析
从’带 KL 约束的奖励最大化’的闭式最优策略出发,反解出奖励的表达式,代入偏好似然,消去奖励得 DPO 损失。
-
【AI 核心深度 M5-043】比较 PPO、DPO 与 GRPO 的依赖与适用场景。(Systematic Comparison of PPO, DPO, and GRPO)深度数理推导与工程落地解析
PPO 需 RM+Critic+在线采样;DPO 只需偏好对与参考模型;GRPO 去 Critic、用组内基线、需可验证奖励。
-
【AI 核心深度 M5-044】解释 ORPO/KTO 的动机与差异。(Motivations and Distinctions of ORPO and KTO)深度数理推导与工程落地解析
ORPO 把 SFT 与偏好优化合并(无需参考模型);KTO 用’好/坏’二值标签(无需配对),数据门槛更低。
-
【AI 核心深度 M5-045】解释 SimPO 的改进点。(SimPO: Simple Preference Optimization Improvements)深度数理推导与工程落地解析
SimPO 去掉参考模型(用长度归一化的平均 log-prob 作为隐式奖励)并加目标奖励间隔 γ,更简单且抗长度偏置。
-
【AI 核心深度 M5-046】解释 DPO 的失败模式与局限。(Failure Modes and Fundamental Limitations of DPO)深度数理推导与工程落地解析
数据分布外无效(假设数据来自参考策略)、易过拟合(似然下降)、长度偏置、对噪声敏感、无法在线探索。
-
【AI 核心深度 M5-047】解释偏好数据的构造与质量控制。(Preference Data Construction and Quality Control)深度数理推导与工程落地解析
偏好对需同一 prompt 的多个回答 + 人工/AI 比较;质量受标注一致性、长度偏差、AI 偏见影响,需去噪与平衡。
-
【AI 核心深度 M5-048】解释 IPO 的动机与改进。(Identity Preference Optimization (IPO) Motivation and Regularization)深度数理推导与工程落地解析
IPO 用’平方损失 + 目标间隔’替代 DPO 的 sigmoid,缓解’过度优化偏好对’与似然位移问题。
-
【AI 核心深度 M5-049】解释 cDPO / RPO 等对噪声偏好数据的鲁棒性改进。(Robustness to Noisy Preferences: cDPO and RPO)深度数理推导与工程落地解析
cDPO 对标签做平滑(假设标注有 ε 概率出错);RPO 加 log-ratio 惩罚项防过度优化;都针对 DPO 的过拟合与噪声敏感。
-
【AI 核心深度 M5-050】解释 DPO 的隐式奖励与它如何用于推理时。(DPO Implicit Reward and Its Use at Inference Time)深度数理推导与工程落地解析
DPO 训练得到的策略定义了隐式奖励 r=β·log(π_θ/π_ref);可用于 best-of-N 重排、评估与数据分析。