Tag: module-m5
-
【AI 核心深度 M5-079】解释向量索引(HNSW / IVF-PQ)与检索效率。(Vector Indexing and Search Efficiency: HNSW vs. IVF-PQ)深度数理推导与工程落地解析
精确检索 O(N) 不可行;HNSW 用多层图近似检索(高召回、低延迟),IVF-PQ 用倒排+乘积量化(省内存)。
-
【AI 核心深度 M5-061】解释零 RL / RLVR 的 cold start 问题。(Cold Start Problem in Zero-RL / RLVR and Mitigation Strategies)深度数理推导与工程落地解析
从纯基座做 RL 可能输出格式混乱、语言混杂、可读性差;冷启动 SFT 或格式奖励可稳定起始阶段。
-
【AI 核心深度 M5-062】解释长 CoT 的长度控制与长度惩罚。(Length Control and Length Penalties in Long CoT Reasoning)深度数理推导与工程落地解析
不控制则长度持续增长、收益递减(过度思考);用超长惩罚、目标长度、自适应预算控制长度。
-
【AI 核心深度 M5-063】解释推理模型的蒸馏(把长 CoT 能力蒸馏到小模型)。(Reasoning Model Distillation: Transferring Long CoT into Compact Models)深度数理推导与工程落地解析
用大模型生成的高质量 CoT 数据做 SFT 蒸馏到小模型;比直接在小模型上做 RL 更高效,但上限受教师限制。
-
【AI 核心深度 M5-064】解释过程奖励模型(PRM)在 RL 中的使用与标注成本。(Process Reward Models (PRM) vs. Outcome Reward Models (ORM): Usage and Annotation Cost)深度数理推导与工程落地解析
PRM 对每个推理步骤打分,提供细粒度信用分配;但需步骤级标注(贵、主观),常与结果奖励结合。
-
【AI 核心深度 M5-065】解释推理模型的效率问题(overthinking / 长度自适应)。(Efficiency Challenges in Reasoning Models: Overthinking and Length Adaptation)深度数理推导与工程落地解析
推理模型对简单问题也长思考(overthinking),浪费成本且可能降低正确率;需难度感知的长度自适应。
-
【AI 核心深度 M5-051】解释 online / iterative DPO 的做法与收益。(Online / Iterative DPO Practices and Benefits)深度数理推导与工程落地解析
用当前策略生成回答、标注偏好、再做 DPO;满足’数据来自当前策略’的假设并恢复在线探索能力。
-
【AI 核心深度 M5-052】解释 DPO 的长度偏置与长度控制方法。(Length Bias in DPO and Length Control Methods)深度数理推导与工程落地解析
log π(y) 是逐 token 求和,长回答天然 log-prob 更低,DPO 倾向更长输出;用长度归一化/惩罚/数据平衡修正。
-
【AI 核心深度 M5-053】解释 DPO 与 SFT 的混合训练策略。(SFT and DPO Hybrid Training Strategies)深度数理推导与工程落地解析
在 DPO 损失中混入一定比例的 SFT 损失(对好回答的 NLL),可防止似然位移、保持生成质量与语言能力。
-
【AI 核心深度 M5-054】写出 GRPO 的优势估计与损失。(Mathematical Formulation of GRPO Advantage Estimation and Loss)深度数理推导与工程落地解析
对每个 prompt 采样一组回答,用组内奖励的均值/标准差归一化作为优势(替代 Critic),再做 PPO 式裁剪优化。