Tag: grpo-reasoning-models
-
【AI 核心深度 M5-061】解释零 RL / RLVR 的 cold start 问题。(Cold Start Problem in Zero-RL / RLVR and Mitigation Strategies)深度数理推导与工程落地解析
从纯基座做 RL 可能输出格式混乱、语言混杂、可读性差;冷启动 SFT 或格式奖励可稳定起始阶段。
-
【AI 核心深度 M5-062】解释长 CoT 的长度控制与长度惩罚。(Length Control and Length Penalties in Long CoT Reasoning)深度数理推导与工程落地解析
不控制则长度持续增长、收益递减(过度思考);用超长惩罚、目标长度、自适应预算控制长度。
-
【AI 核心深度 M5-063】解释推理模型的蒸馏(把长 CoT 能力蒸馏到小模型)。(Reasoning Model Distillation: Transferring Long CoT into Compact Models)深度数理推导与工程落地解析
用大模型生成的高质量 CoT 数据做 SFT 蒸馏到小模型;比直接在小模型上做 RL 更高效,但上限受教师限制。
-
【AI 核心深度 M5-064】解释过程奖励模型(PRM)在 RL 中的使用与标注成本。(Process Reward Models (PRM) vs. Outcome Reward Models (ORM): Usage and Annotation Cost)深度数理推导与工程落地解析
PRM 对每个推理步骤打分,提供细粒度信用分配;但需步骤级标注(贵、主观),常与结果奖励结合。
-
【AI 核心深度 M5-065】解释推理模型的效率问题(overthinking / 长度自适应)。(Efficiency Challenges in Reasoning Models: Overthinking and Length Adaptation)深度数理推导与工程落地解析
推理模型对简单问题也长思考(overthinking),浪费成本且可能降低正确率;需难度感知的长度自适应。
-
【AI 核心深度 M5-054】写出 GRPO 的优势估计与损失。(Mathematical Formulation of GRPO Advantage Estimation and Loss)深度数理推导与工程落地解析
对每个 prompt 采样一组回答,用组内奖励的均值/标准差归一化作为优势(替代 Critic),再做 PPO 式裁剪优化。
-
【AI 核心深度 M5-055】解释可验证奖励(RLVR)与它的优势。(Reinforcement Learning with Verifiable Rewards (RLVR) and Its Advantages)深度数理推导与工程落地解析
用程序/规则验证答案正确性(数学对答案、代码跑测试)作为奖励;精确、不可被钻空子、无需人工标注。
-
【AI 核心深度 M5-056】解释 GSPO 的改进动机。(GSPO (Group Sequence Preference Optimization) Improvement Motivations)深度数理推导与工程落地解析
GRPO 的 token 级重要性比在长序列下方差爆炸;GSPO 用序列级(长度归一化)的重要性比,稳定长 CoT 训练。
-
【AI 核心深度 M5-057】解释 DAPO 的改进点。(DAPO (Decoupled Advantage Policy Optimization) Improvement Highlights)深度数理推导与工程落地解析
四项改进:clip-higher(非对称裁剪)、动态采样(过滤全对/全错)、token 级损失归一化、超长奖励整形。
-
【AI 核心深度 M5-058】解释推理模型的训练范式(长 CoT + RL)。(Reasoning Model Training Paradigm: Long CoT and Reinforcement Learning)深度数理推导与工程落地解析
用 RLVR 训练模型生成更长的推理链(CoT),奖励正确性;模型自发学会自我验证、回溯与更长的思考。