AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-023】解释 CoT 蒸馏的作用与风险。(Chain-of-Thought (CoT) Distillation: Benefits and Hallucination Risks)深度数理推导与工程落地解析
用强模型的推理轨迹(含中间步骤)做 SFT,可显著提升小模型的推理;风险是’模仿格式而非能力’与错误继承。
【AI 核心深度 M5-024】解释 SFT 数据配比与多任务平衡。(SFT Data Mixture and Multi-Task Balancing)深度数理推导与工程落地解析
多任务混合需平衡各任务的样本量与难度,避免’强任务主导’或’弱任务被淹没’;用温度采样/权重调整。
【AI 核心深度 M5-025】解释 SFT 与 RLHF/DPO 的分工。(Division of Labor Between SFT and RLHF/DPO)深度数理推导与工程落地解析
SFT 用演示教’格式与基本行为’(模仿);RLHF/DPO 用偏好教’质量与取舍’(优化),后者需前者提供起点。
【AI 核心深度 M5-026】解释 SFT 的学习率与训练轮数的选择。(Choosing Learning Rates and Epochs in SFT)深度数理推导与工程落地解析
SFT 用远低于预训练的 lr(1e-5~2e-5)与极少 epoch(1~3);小数据需更低 lr 或更强正则,否则过拟合。
【AI 核心深度 M5-027】解释 chat template 与多轮对话的构造。(Chat Template Formatting and Multi-Turn Conversation Construction)深度数理推导与工程落地解析
chat template 定义角色标记与格式;多轮数据需构造历史并决定损失落在哪些轮,格式不一致会损害指令遵循。
【AI 核心深度 M5-028】解释拒绝采样微调(RFT / STaR)的机制与作用。(Rejection Sampling Fine-Tuning (RFT / STaR) Mechanisms)深度数理推导与工程落地解析
用模型自己生成多个答案,按正确性/奖励筛选后做 SFT;迭代进行可自我提升,是可验证任务的标准做法。
【AI 核心深度 M5-029】解释 SFT 数据来源的选择与各自取舍(人工 / 强模型蒸馏 / 开源 / 合成+验证)。(SFT Data Sources and Engineering Trade-offs)深度数理推导与工程落地解析
人工质量最高但贵且慢;强模型蒸馏可扩展但有同质化与合规风险;开源便利但质量参差;合成+验证对可验证任务最优。
【AI 核心深度 M5-030】描述 RLHF 的三阶段流程。(The Three-Stage RLHF Pipeline)深度数理推导与工程落地解析
① SFT 得到初始策略;② 用人类偏好比较训练奖励模型;③ 用 PPO 在奖励模型上优化策略(带 KL 约束)。
【AI 核心深度 M5-031】写出 Bradley-Terry 偏好模型与奖励模型损失。(Bradley-Terry Preference Model and Reward Model Loss Formulation)深度数理推导与工程落地解析
BT 模型假设 P(y_w≻y_l)=σ(r(y_w)−r(y_l));用该似然训练奖励模型,即 pairwiselogistic 损失。
【AI 核心深度 M5-032】写出 PPO 的裁剪目标,并解释 min 与 clip 的作用。(PPO Clipped Surrogate Objective and the Rationale for Min and Clip)深度数理推导与工程落地解析
目标为 min(ratio·A, clip(ratio,1−ε,1+ε)·A);clip 限制单步策略变化,min 取保守下界,保证不过度更新。
【AI 核心深度 M5-033】解释 GAE 与优势估计在 RLHF 中的作用。(Generalized Advantage Estimation (GAE) and Advantage in RLHF)深度数理推导与工程落地解析
GAE 用 TD 残差的指数加权和估计优势,平衡偏差与方差;优势函数决定’该动作比平均好多少’。
【AI 核心深度 M5-034】解释奖励黑客(reward hacking)与缓解手段。(Reward Hacking and Mitigation Strategies in RLHF)深度数理推导与工程落地解析
策略钻奖励模型的空子(如冗长、谄媚、格式取巧),奖励升而真实质量降;用 KL 约束、集成、迭代更新、规则过滤缓解。
【AI 核心深度 M5-035】解释 RLHF 的工程难点与稳定性问题。(Engineering Challenges and Stability Issues in RLHF)深度数理推导与工程落地解析
需同时维护 4 个模型(显存大);训练不稳定(奖励崩塌、KL 爆炸、长度漂移);超参敏感且难调。
【AI 核心深度 M5-036】解释 RLHF 中的 KL 惩罚系数与它的作用。(The Role and Dynamics of the KL Penalty Coefficient in RLHF)深度数理推导与工程落地解析
KL 约束策略不偏离参考模型;β 太小导致奖励黑客与语言退化,太大导致学不到新行为;常用 0.01~0.1 或自适应。
【AI 核心深度 M5-008】解释数据质量与配比对预训练的影响。(Impact of Data Quality and Mixture Ratios on Pre-training)深度数理推导与工程落地解析
数据质量(去重、过滤、格式)比数量更关键;配比(领域权重、重复次数)影响能力分布,需实验确定。