Tag: alignment-rlhf
-
【AI 核心深度 M5-035】解释 RLHF 的工程难点与稳定性问题。(Engineering Challenges and Stability Issues in RLHF)深度数理推导与工程落地解析
需同时维护 4 个模型(显存大);训练不稳定(奖励崩塌、KL 爆炸、长度漂移);超参敏感且难调。
-
【AI 核心深度 M5-036】解释 RLHF 中的 KL 惩罚系数与它的作用。(The Role and Dynamics of the KL Penalty Coefficient in RLHF)深度数理推导与工程落地解析
KL 约束策略不偏离参考模型;β 太小导致奖励黑客与语言退化,太大导致学不到新行为;常用 0.01~0.1 或自适应。