AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-060】解释 GRPO 的 group size 与采样效率。(Group Size and Sampling Efficiency in GRPO)深度数理推导与工程落地解析
G 越大基线越准但采样成本 ∝G;G 太小则优势估计噪声大;常用 8~64,且需处理’全对/全错’的退化。
【AI 核心深度 M5-037】解释奖励模型的泛化与过优化(over-optimization)。(Reward Model Generalization and Over-Optimization)深度数理推导与工程落地解析
RM 只在偏好数据分布上可靠;策略越优化越会进入 RM 的分布外区域,导致奖励升而真实质量降(Goodhart)。
【AI 核心深度 M5-038】解释 RLHF 的 on-policy 采样与 off-policy 数据。(On-Policy Sampling vs. Off-Policy Data in RLHF)深度数理推导与工程落地解析
PPO 需 on-policy 采样(当前策略生成)保证重要性采样正确;RM 训练常用 off-policy 数据;迭代式 RLHF 混合两者。
【AI 核心深度 M5-039】解释 PPO 在 LLM 中的实现细节(token-level vs sequence-level)。(PPO Implementation Nuances in LLMs: Token-Level vs. Sequence-Level)深度数理推导与工程落地解析
动作是 token 但奖励是序列级;实现上 ratio 与 KL 按 token 算、优势广播到 token;只对回答 token 算损失。
【AI 核心深度 M5-040】解释迭代式 RLHF / online RLHF 的动机与做法。(Motivations and Practices of Iterative / Online RLHF)深度数理推导与工程落地解析
单轮 RLHF 会因 RM 过优化而退化;迭代式定期用新策略输出重新标注、更新 RM,缩小分布外区域。
【AI 核心深度 M5-041】解释 Constitutional AI 与 RLAIF。(Constitutional AI and RLAIF (Reinforcement Learning from AI Feedback))深度数理推导与工程落地解析
CAI 用’宪法’(原则清单)让模型自我批评与修订,再由 AI 依宪法标注偏好;RLAIF 用 AI 反馈替代人工。
【AI 核心深度 M5-042】完整推导 DPO 损失。(Full Mathematical Derivation of Direct Preference Optimization (DPO) Loss)深度数理推导与工程落地解析
从’带 KL 约束的奖励最大化’的闭式最优策略出发,反解出奖励的表达式,代入偏好似然,消去奖励得 DPO 损失。
【AI 核心深度 M5-043】比较 PPO、DPO 与 GRPO 的依赖与适用场景。(Systematic Comparison of PPO, DPO, and GRPO)深度数理推导与工程落地解析
PPO 需 RM+Critic+在线采样;DPO 只需偏好对与参考模型;GRPO 去 Critic、用组内基线、需可验证奖励。
【AI 核心深度 M5-044】解释 ORPO/KTO 的动机与差异。(Motivations and Distinctions of ORPO and KTO)深度数理推导与工程落地解析
ORPO 把 SFT 与偏好优化合并(无需参考模型);KTO 用’好/坏’二值标签(无需配对),数据门槛更低。
【AI 核心深度 M5-045】解释 SimPO 的改进点。(SimPO: Simple Preference Optimization Improvements)深度数理推导与工程落地解析
SimPO 去掉参考模型(用长度归一化的平均 log-prob 作为隐式奖励)并加目标奖励间隔 γ,更简单且抗长度偏置。
【AI 核心深度 M5-046】解释 DPO 的失败模式与局限。(Failure Modes and Fundamental Limitations of DPO)深度数理推导与工程落地解析
数据分布外无效(假设数据来自参考策略)、易过拟合(似然下降)、长度偏置、对噪声敏感、无法在线探索。
【AI 核心深度 M5-047】解释偏好数据的构造与质量控制。(Preference Data Construction and Quality Control)深度数理推导与工程落地解析
偏好对需同一 prompt 的多个回答 + 人工/AI 比较;质量受标注一致性、长度偏差、AI 偏见影响,需去噪与平衡。
【AI 核心深度 M5-048】解释 IPO 的动机与改进。(Identity Preference Optimization (IPO) Motivation and Regularization)深度数理推导与工程落地解析
IPO 用’平方损失 + 目标间隔’替代 DPO 的 sigmoid,缓解’过度优化偏好对’与似然位移问题。
【AI 核心深度 M5-049】解释 cDPO / RPO 等对噪声偏好数据的鲁棒性改进。(Robustness to Noisy Preferences: cDPO and RPO)深度数理推导与工程落地解析
cDPO 对标签做平滑(假设标注有 ε 概率出错);RPO 加 log-ratio 惩罚项防过度优化;都针对 DPO 的过拟合与噪声敏感。
【AI 核心深度 M5-050】解释 DPO 的隐式奖励与它如何用于推理时。(DPO Implicit Reward and Its Use at Inference Time)深度数理推导与工程落地解析
DPO 训练得到的策略定义了隐式奖励 r=β·log(π_θ/π_ref);可用于 best-of-N 重排、评估与数据分析。