Tag: alignment_rl
-
【AI 工业核题 F7】多臂老虎机探索策略(epsilon-Greedy 与 UCB1)(Multi-Armed Bandit: epsilon-Greedy & UCB1)深度实现与原理解析
强化学习与推荐系统探索/利用(Exploration vs Exploitation)核心算法,置信区间上界打分。
-
【AI 工业核题 F6】KL 散度与自适应惩罚项(前向 vs 逆向 KL)(KL Divergence & Adaptive Penalty)深度实现与原理解析
测量两个概率分布的距离,大模型对齐防止策略跑偏的核心约束惩罚项。
-
【AI 工业核题 F5】GAE(广义优势估计)(Generalized Advantage Estimation (GAE))深度实现与原理解析
通过指数加权移动平均在单步 TD 误差(低方差高偏差)与全蒙特卡洛回报(零偏差高方差)之间达成最优权衡。
-
【AI 工业核题 F4】GRPO 组内相对优势归一化(DeepSeek 核心免 Critic 架构)(Group Relative Policy Optimization (GRPO))深度实现与原理解析
DeepSeekMath / DeepSeek-R1 核心基石,彻底砍掉同等规模的 Critic 价值网络,组内自归一化节省 50% 显存。
-
【AI 工业核题 F3】PPO 裁剪代理目标损失(Clipped Surrogate Objective)(PPO Clipped Surrogate Objective Loss)深度实现与原理解析
OpenAI 强化学习基石,通过重要性采样概率比与 [1-eps, 1+eps] 截断防止策略单步更新步子迈太大崩盘。
-
【AI 工业核题 F2】DPO 直接偏好优化损失(免奖励模型对齐)(Direct Preference Optimization (DPO))深度实现与原理解析
斯坦福团队里程碑,彻底抛弃独立 Reward Model 与 PPO 采样,显式解析求解直接在策略网络上微调偏好。
-
【AI 工业核题 F1】Bradley-Terry 奖励模型损失(偏好对数似然)(Bradley-Terry Preference Reward Model Loss)深度实现与原理解析
InstructGPT / RLHF 奖励模型的核心训练目标,Chosen 胜过 Rejected 标量分差的 Sigmoid 交叉熵。