Tag: dpo-family-dpo-kto-orpo
-
【AI 核心深度 M5-051】解释 online / iterative DPO 的做法与收益。(Online / Iterative DPO Practices and Benefits)深度数理推导与工程落地解析
用当前策略生成回答、标注偏好、再做 DPO;满足’数据来自当前策略’的假设并恢复在线探索能力。
-
【AI 核心深度 M5-052】解释 DPO 的长度偏置与长度控制方法。(Length Bias in DPO and Length Control Methods)深度数理推导与工程落地解析
log π(y) 是逐 token 求和,长回答天然 log-prob 更低,DPO 倾向更长输出;用长度归一化/惩罚/数据平衡修正。
-
【AI 核心深度 M5-053】解释 DPO 与 SFT 的混合训练策略。(SFT and DPO Hybrid Training Strategies)深度数理推导与工程落地解析
在 DPO 损失中混入一定比例的 SFT 损失(对好回答的 NLL),可防止似然位移、保持生成质量与语言能力。
-
【AI 核心深度 M5-042】完整推导 DPO 损失。(Full Mathematical Derivation of Direct Preference Optimization (DPO) Loss)深度数理推导与工程落地解析
从’带 KL 约束的奖励最大化’的闭式最优策略出发,反解出奖励的表达式,代入偏好似然,消去奖励得 DPO 损失。
-
【AI 核心深度 M5-043】比较 PPO、DPO 与 GRPO 的依赖与适用场景。(Systematic Comparison of PPO, DPO, and GRPO)深度数理推导与工程落地解析
PPO 需 RM+Critic+在线采样;DPO 只需偏好对与参考模型;GRPO 去 Critic、用组内基线、需可验证奖励。
-
【AI 核心深度 M5-044】解释 ORPO/KTO 的动机与差异。(Motivations and Distinctions of ORPO and KTO)深度数理推导与工程落地解析
ORPO 把 SFT 与偏好优化合并(无需参考模型);KTO 用’好/坏’二值标签(无需配对),数据门槛更低。
-
【AI 核心深度 M5-045】解释 SimPO 的改进点。(SimPO: Simple Preference Optimization Improvements)深度数理推导与工程落地解析
SimPO 去掉参考模型(用长度归一化的平均 log-prob 作为隐式奖励)并加目标奖励间隔 γ,更简单且抗长度偏置。
-
【AI 核心深度 M5-046】解释 DPO 的失败模式与局限。(Failure Modes and Fundamental Limitations of DPO)深度数理推导与工程落地解析
数据分布外无效(假设数据来自参考策略)、易过拟合(似然下降)、长度偏置、对噪声敏感、无法在线探索。
-
【AI 核心深度 M5-047】解释偏好数据的构造与质量控制。(Preference Data Construction and Quality Control)深度数理推导与工程落地解析
偏好对需同一 prompt 的多个回答 + 人工/AI 比较;质量受标注一致性、长度偏差、AI 偏见影响,需去噪与平衡。
-
【AI 核心深度 M5-048】解释 IPO 的动机与改进。(Identity Preference Optimization (IPO) Motivation and Regularization)深度数理推导与工程落地解析
IPO 用’平方损失 + 目标间隔’替代 DPO 的 sigmoid,缓解’过度优化偏好对’与似然位移问题。