Tag: instruction-tuning-supervised-fine-tunin
-
【AI 核心深度 M5-023】解释 CoT 蒸馏的作用与风险。(Chain-of-Thought (CoT) Distillation: Benefits and Hallucination Risks)深度数理推导与工程落地解析
用强模型的推理轨迹(含中间步骤)做 SFT,可显著提升小模型的推理;风险是’模仿格式而非能力’与错误继承。
-
【AI 核心深度 M5-024】解释 SFT 数据配比与多任务平衡。(SFT Data Mixture and Multi-Task Balancing)深度数理推导与工程落地解析
多任务混合需平衡各任务的样本量与难度,避免’强任务主导’或’弱任务被淹没’;用温度采样/权重调整。
-
【AI 核心深度 M5-025】解释 SFT 与 RLHF/DPO 的分工。(Division of Labor Between SFT and RLHF/DPO)深度数理推导与工程落地解析
SFT 用演示教’格式与基本行为’(模仿);RLHF/DPO 用偏好教’质量与取舍’(优化),后者需前者提供起点。
-
【AI 核心深度 M5-026】解释 SFT 的学习率与训练轮数的选择。(Choosing Learning Rates and Epochs in SFT)深度数理推导与工程落地解析
SFT 用远低于预训练的 lr(1e-5~2e-5)与极少 epoch(1~3);小数据需更低 lr 或更强正则,否则过拟合。
-
【AI 核心深度 M5-027】解释 chat template 与多轮对话的构造。(Chat Template Formatting and Multi-Turn Conversation Construction)深度数理推导与工程落地解析
chat template 定义角色标记与格式;多轮数据需构造历史并决定损失落在哪些轮,格式不一致会损害指令遵循。
-
【AI 核心深度 M5-028】解释拒绝采样微调(RFT / STaR)的机制与作用。(Rejection Sampling Fine-Tuning (RFT / STaR) Mechanisms)深度数理推导与工程落地解析
用模型自己生成多个答案,按正确性/奖励筛选后做 SFT;迭代进行可自我提升,是可验证任务的标准做法。
-
【AI 核心深度 M5-029】解释 SFT 数据来源的选择与各自取舍(人工 / 强模型蒸馏 / 开源 / 合成+验证)。(SFT Data Sources and Engineering Trade-offs)深度数理推导与工程落地解析
人工质量最高但贵且慢;强模型蒸馏可扩展但有同质化与合规风险;开源便利但质量参差;合成+验证对可验证任务最优。
-
【AI 核心深度 M5-020】解释 SFT 的目标与数据构造要点。(Supervised Fine-Tuning (SFT) Objectives and Data Construction Principles)深度数理推导与工程落地解析
SFT 用(指令,回答)对做监督微调,教会模型’按指令作答’的格式与风格;数据需多样、高质量、格式一致。
-
【AI 核心深度 M5-021】解释损失掩码与序列打包(packing)的作用。(Loss Masking and Sequence Packing in SFT Training)深度数理推导与工程落地解析
损失掩码让损失只算在回答上;打包把多条短样本拼成定长序列以提高利用率,需用注意力隔离防跨样本泄漏。
-
【AI 核心深度 M5-022】解释 SFT 中的灾难性遗忘与缓解。(Catastrophic Forgetting in SFT and Mitigation Strategies)深度数理推导与工程落地解析
SFT 在小数据上微调会损害预训练的通用能力;用低 lr、少 epoch、混合通用数据、LoRA/正则缓解。