Tag: module-m5
-
【AI 核心深度 M5-033】解释 GAE 与优势估计在 RLHF 中的作用。(Generalized Advantage Estimation (GAE) and Advantage in RLHF)深度数理推导与工程落地解析
GAE 用 TD 残差的指数加权和估计优势,平衡偏差与方差;优势函数决定’该动作比平均好多少’。
-
【AI 核心深度 M5-034】解释奖励黑客(reward hacking)与缓解手段。(Reward Hacking and Mitigation Strategies in RLHF)深度数理推导与工程落地解析
策略钻奖励模型的空子(如冗长、谄媚、格式取巧),奖励升而真实质量降;用 KL 约束、集成、迭代更新、规则过滤缓解。
-
【AI 核心深度 M5-035】解释 RLHF 的工程难点与稳定性问题。(Engineering Challenges and Stability Issues in RLHF)深度数理推导与工程落地解析
需同时维护 4 个模型(显存大);训练不稳定(奖励崩塌、KL 爆炸、长度漂移);超参敏感且难调。
-
【AI 核心深度 M5-036】解释 RLHF 中的 KL 惩罚系数与它的作用。(The Role and Dynamics of the KL Penalty Coefficient in RLHF)深度数理推导与工程落地解析
KL 约束策略不偏离参考模型;β 太小导致奖励黑客与语言退化,太大导致学不到新行为;常用 0.01~0.1 或自适应。
-
【AI 核心深度 M5-008】解释数据质量与配比对预训练的影响。(Impact of Data Quality and Mixture Ratios on Pre-training)深度数理推导与工程落地解析
数据质量(去重、过滤、格式)比数量更关键;配比(领域权重、重复次数)影响能力分布,需实验确定。
-
【AI 核心深度 M5-009】解释数据去重的方法与它为什么重要。(Data Deduplication Methods and Why It Matters in LLM Pre-training)深度数理推导与工程落地解析
精确去重(哈希)与近似去重(MinHash/LSH、SimHash);去重防止记忆、减少评测污染、提升训练效率。
-
【AI 核心深度 M5-010】解释课程学习与数据排序对训练的作用。(Curriculum Learning and Data Ordering in LLM Pre-training)深度数理推导与工程落地解析
按’由易到难’或’由通用到专业’排序数据可提升收敛与最终质量;但结论不稳健,需谨慎验证。
-
【AI 核心深度 M5-011】解释合成数据在预训练/后训练中的作用与风险。(Synthetic Data in Pre-training and Post-Training: Roles and Risks)深度数理推导与工程落地解析
用强模型/规则生成数据(教科书式、指令、CoT);可补齐稀缺能力,但有分布偏移、同质化与’模型坍缩’风险。
-
【AI 核心深度 M5-012】解释数据污染(contamination)与它对评测可信度的影响。(Data Contamination and Its Impact on Benchmark Reliability)深度数理推导与工程落地解析
测试集内容出现在训练数据中使评测虚高;需 n-gram 重叠检测、成员推断、以及新测试集验证。
-
【AI 核心深度 M5-013】解释预训练数据的领域配比与退火阶段(annealing)的作用。(Pre-training Domain Mixtures and the Role of the Annealing Phase)深度数理推导与工程落地解析
领域配比决定能力分布;退火阶段在训练末尾用高质量/领域数据并降 lr,低成本地强化目标能力。