Tag: module-m5
-
【AI 核心深度 M5-023】解释 CoT 蒸馏的作用与风险。(Chain-of-Thought (CoT) Distillation: Benefits and Hallucination Risks)深度数理推导与工程落地解析
用强模型的推理轨迹(含中间步骤)做 SFT,可显著提升小模型的推理;风险是’模仿格式而非能力’与错误继承。
-
【AI 核心深度 M5-024】解释 SFT 数据配比与多任务平衡。(SFT Data Mixture and Multi-Task Balancing)深度数理推导与工程落地解析
多任务混合需平衡各任务的样本量与难度,避免’强任务主导’或’弱任务被淹没’;用温度采样/权重调整。
-
【AI 核心深度 M5-025】解释 SFT 与 RLHF/DPO 的分工。(Division of Labor Between SFT and RLHF/DPO)深度数理推导与工程落地解析
SFT 用演示教’格式与基本行为’(模仿);RLHF/DPO 用偏好教’质量与取舍’(优化),后者需前者提供起点。
-
【AI 核心深度 M5-026】解释 SFT 的学习率与训练轮数的选择。(Choosing Learning Rates and Epochs in SFT)深度数理推导与工程落地解析
SFT 用远低于预训练的 lr(1e-5~2e-5)与极少 epoch(1~3);小数据需更低 lr 或更强正则,否则过拟合。
-
【AI 核心深度 M5-027】解释 chat template 与多轮对话的构造。(Chat Template Formatting and Multi-Turn Conversation Construction)深度数理推导与工程落地解析
chat template 定义角色标记与格式;多轮数据需构造历史并决定损失落在哪些轮,格式不一致会损害指令遵循。
-
【AI 核心深度 M5-028】解释拒绝采样微调(RFT / STaR)的机制与作用。(Rejection Sampling Fine-Tuning (RFT / STaR) Mechanisms)深度数理推导与工程落地解析
用模型自己生成多个答案,按正确性/奖励筛选后做 SFT;迭代进行可自我提升,是可验证任务的标准做法。
-
【AI 核心深度 M5-029】解释 SFT 数据来源的选择与各自取舍(人工 / 强模型蒸馏 / 开源 / 合成+验证)。(SFT Data Sources and Engineering Trade-offs)深度数理推导与工程落地解析
人工质量最高但贵且慢;强模型蒸馏可扩展但有同质化与合规风险;开源便利但质量参差;合成+验证对可验证任务最优。
-
【AI 核心深度 M5-030】描述 RLHF 的三阶段流程。(The Three-Stage RLHF Pipeline)深度数理推导与工程落地解析
① SFT 得到初始策略;② 用人类偏好比较训练奖励模型;③ 用 PPO 在奖励模型上优化策略(带 KL 约束)。
-
【AI 核心深度 M5-031】写出 Bradley-Terry 偏好模型与奖励模型损失。(Bradley-Terry Preference Model and Reward Model Loss Formulation)深度数理推导与工程落地解析
BT 模型假设 P(y_w≻y_l)=σ(r(y_w)−r(y_l));用该似然训练奖励模型,即 pairwiselogistic 损失。
-
【AI 核心深度 M5-032】写出 PPO 的裁剪目标,并解释 min 与 clip 的作用。(PPO Clipped Surrogate Objective and the Rationale for Min and Clip)深度数理推导与工程落地解析
目标为 min(ratio·A, clip(ratio,1−ε,1+ε)·A);clip 限制单步策略变化,min 取保守下界,保证不过度更新。