Tag: module-m5
-
【AI 核心深度 M5-055】解释可验证奖励(RLVR)与它的优势。(Reinforcement Learning with Verifiable Rewards (RLVR) and Its Advantages)深度数理推导与工程落地解析
用程序/规则验证答案正确性(数学对答案、代码跑测试)作为奖励;精确、不可被钻空子、无需人工标注。
-
【AI 核心深度 M5-056】解释 GSPO 的改进动机。(GSPO (Group Sequence Preference Optimization) Improvement Motivations)深度数理推导与工程落地解析
GRPO 的 token 级重要性比在长序列下方差爆炸;GSPO 用序列级(长度归一化)的重要性比,稳定长 CoT 训练。
-
【AI 核心深度 M5-057】解释 DAPO 的改进点。(DAPO (Decoupled Advantage Policy Optimization) Improvement Highlights)深度数理推导与工程落地解析
四项改进:clip-higher(非对称裁剪)、动态采样(过滤全对/全错)、token 级损失归一化、超长奖励整形。
-
【AI 核心深度 M5-058】解释推理模型的训练范式(长 CoT + RL)。(Reasoning Model Training Paradigm: Long CoT and Reinforcement Learning)深度数理推导与工程落地解析
用 RLVR 训练模型生成更长的推理链(CoT),奖励正确性;模型自发学会自我验证、回溯与更长的思考。
-
【AI 核心深度 M5-059】解释推理模型的评估与成本权衡。(Evaluation and Cost Trade-offs of Reasoning Models)深度数理推导与工程落地解析
评估需覆盖多难度与多领域(且防污染);成本 ∝ 输出长度,需在准确率与 token 成本间权衡(自适应推理)。
-
【AI 核心深度 M5-060】解释 GRPO 的 group size 与采样效率。(Group Size and Sampling Efficiency in GRPO)深度数理推导与工程落地解析
G 越大基线越准但采样成本 ∝G;G 太小则优势估计噪声大;常用 8~64,且需处理’全对/全错’的退化。
-
【AI 核心深度 M5-037】解释奖励模型的泛化与过优化(over-optimization)。(Reward Model Generalization and Over-Optimization)深度数理推导与工程落地解析
RM 只在偏好数据分布上可靠;策略越优化越会进入 RM 的分布外区域,导致奖励升而真实质量降(Goodhart)。
-
【AI 核心深度 M5-038】解释 RLHF 的 on-policy 采样与 off-policy 数据。(On-Policy Sampling vs. Off-Policy Data in RLHF)深度数理推导与工程落地解析
PPO 需 on-policy 采样(当前策略生成)保证重要性采样正确;RM 训练常用 off-policy 数据;迭代式 RLHF 混合两者。
-
【AI 核心深度 M5-039】解释 PPO 在 LLM 中的实现细节(token-level vs sequence-level)。(PPO Implementation Nuances in LLMs: Token-Level vs. Sequence-Level)深度数理推导与工程落地解析
动作是 token 但奖励是序列级;实现上 ratio 与 KL 按 token 算、优势广播到 token;只对回答 token 算损失。
-
【AI 核心深度 M5-040】解释迭代式 RLHF / online RLHF 的动机与做法。(Motivations and Practices of Iterative / Online RLHF)深度数理推导与工程落地解析
单轮 RLHF 会因 RM 过优化而退化;迭代式定期用新策略输出重新标注、更新 RM,缩小分布外区域。