Tag: dpo-family-dpo-kto-orpo
-
【AI 核心深度 M5-049】解释 cDPO / RPO 等对噪声偏好数据的鲁棒性改进。(Robustness to Noisy Preferences: cDPO and RPO)深度数理推导与工程落地解析
cDPO 对标签做平滑(假设标注有 ε 概率出错);RPO 加 log-ratio 惩罚项防过度优化;都针对 DPO 的过拟合与噪声敏感。
-
【AI 核心深度 M5-050】解释 DPO 的隐式奖励与它如何用于推理时。(DPO Implicit Reward and Its Use at Inference Time)深度数理推导与工程落地解析
DPO 训练得到的策略定义了隐式奖励 r=β·log(π_θ/π_ref);可用于 best-of-N 重排、评估与数据分析。