AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-079】解释向量索引(HNSW / IVF-PQ)与检索效率。(Vector Indexing and Search Efficiency: HNSW vs. IVF-PQ)深度数理推导与工程落地解析
精确检索 O(N) 不可行;HNSW 用多层图近似检索(高召回、低延迟),IVF-PQ 用倒排+乘积量化(省内存)。
【AI 核心深度 M5-061】解释零 RL / RLVR 的 cold start 问题。(Cold Start Problem in Zero-RL / RLVR and Mitigation Strategies)深度数理推导与工程落地解析
从纯基座做 RL 可能输出格式混乱、语言混杂、可读性差;冷启动 SFT 或格式奖励可稳定起始阶段。
【AI 核心深度 M5-062】解释长 CoT 的长度控制与长度惩罚。(Length Control and Length Penalties in Long CoT Reasoning)深度数理推导与工程落地解析
不控制则长度持续增长、收益递减(过度思考);用超长惩罚、目标长度、自适应预算控制长度。
【AI 核心深度 M5-063】解释推理模型的蒸馏(把长 CoT 能力蒸馏到小模型)。(Reasoning Model Distillation: Transferring Long CoT into Compact Models)深度数理推导与工程落地解析
用大模型生成的高质量 CoT 数据做 SFT 蒸馏到小模型;比直接在小模型上做 RL 更高效,但上限受教师限制。
【AI 核心深度 M5-064】解释过程奖励模型(PRM)在 RL 中的使用与标注成本。(Process Reward Models (PRM) vs. Outcome Reward Models (ORM): Usage and Annotation Cost)深度数理推导与工程落地解析
PRM 对每个推理步骤打分,提供细粒度信用分配;但需步骤级标注(贵、主观),常与结果奖励结合。
【AI 核心深度 M5-065】解释推理模型的效率问题(overthinking / 长度自适应)。(Efficiency Challenges in Reasoning Models: Overthinking and Length Adaptation)深度数理推导与工程落地解析
推理模型对简单问题也长思考(overthinking),浪费成本且可能降低正确率;需难度感知的长度自适应。
【AI 核心深度 M5-051】解释 online / iterative DPO 的做法与收益。(Online / Iterative DPO Practices and Benefits)深度数理推导与工程落地解析
用当前策略生成回答、标注偏好、再做 DPO;满足’数据来自当前策略’的假设并恢复在线探索能力。
【AI 核心深度 M5-052】解释 DPO 的长度偏置与长度控制方法。(Length Bias in DPO and Length Control Methods)深度数理推导与工程落地解析
log π(y) 是逐 token 求和,长回答天然 log-prob 更低,DPO 倾向更长输出;用长度归一化/惩罚/数据平衡修正。
【AI 核心深度 M5-053】解释 DPO 与 SFT 的混合训练策略。(SFT and DPO Hybrid Training Strategies)深度数理推导与工程落地解析
在 DPO 损失中混入一定比例的 SFT 损失(对好回答的 NLL),可防止似然位移、保持生成质量与语言能力。
【AI 核心深度 M5-054】写出 GRPO 的优势估计与损失。(Mathematical Formulation of GRPO Advantage Estimation and Loss)深度数理推导与工程落地解析
对每个 prompt 采样一组回答,用组内奖励的均值/标准差归一化作为优势(替代 Critic),再做 PPO 式裁剪优化。
【AI 核心深度 M5-055】解释可验证奖励(RLVR)与它的优势。(Reinforcement Learning with Verifiable Rewards (RLVR) and Its Advantages)深度数理推导与工程落地解析
用程序/规则验证答案正确性(数学对答案、代码跑测试)作为奖励;精确、不可被钻空子、无需人工标注。
【AI 核心深度 M5-056】解释 GSPO 的改进动机。(GSPO (Group Sequence Preference Optimization) Improvement Motivations)深度数理推导与工程落地解析
GRPO 的 token 级重要性比在长序列下方差爆炸;GSPO 用序列级(长度归一化)的重要性比,稳定长 CoT 训练。
【AI 核心深度 M5-057】解释 DAPO 的改进点。(DAPO (Decoupled Advantage Policy Optimization) Improvement Highlights)深度数理推导与工程落地解析
四项改进:clip-higher(非对称裁剪)、动态采样(过滤全对/全错)、token 级损失归一化、超长奖励整形。
【AI 核心深度 M5-058】解释推理模型的训练范式(长 CoT + RL)。(Reasoning Model Training Paradigm: Long CoT and Reinforcement Learning)深度数理推导与工程落地解析
用 RLVR 训练模型生成更长的推理链(CoT),奖励正确性;模型自发学会自我验证、回溯与更长的思考。
【AI 核心深度 M5-059】解释推理模型的评估与成本权衡。(Evaluation and Cost Trade-offs of Reasoning Models)深度数理推导与工程落地解析
评估需覆盖多难度与多领域(且防污染);成本 ∝ 输出长度,需在准确率与 token 成本间权衡(自适应推理)。