Tag: pretraining-objectives-data-curation
-
【AI 核心深度 M5-008】解释数据质量与配比对预训练的影响。(Impact of Data Quality and Mixture Ratios on Pre-training)深度数理推导与工程落地解析
数据质量(去重、过滤、格式)比数量更关键;配比(领域权重、重复次数)影响能力分布,需实验确定。
-
【AI 核心深度 M5-009】解释数据去重的方法与它为什么重要。(Data Deduplication Methods and Why It Matters in LLM Pre-training)深度数理推导与工程落地解析
精确去重(哈希)与近似去重(MinHash/LSH、SimHash);去重防止记忆、减少评测污染、提升训练效率。
-
【AI 核心深度 M5-010】解释课程学习与数据排序对训练的作用。(Curriculum Learning and Data Ordering in LLM Pre-training)深度数理推导与工程落地解析
按’由易到难’或’由通用到专业’排序数据可提升收敛与最终质量;但结论不稳健,需谨慎验证。
-
【AI 核心深度 M5-011】解释合成数据在预训练/后训练中的作用与风险。(Synthetic Data in Pre-training and Post-Training: Roles and Risks)深度数理推导与工程落地解析
用强模型/规则生成数据(教科书式、指令、CoT);可补齐稀缺能力,但有分布偏移、同质化与’模型坍缩’风险。
-
【AI 核心深度 M5-012】解释数据污染(contamination)与它对评测可信度的影响。(Data Contamination and Its Impact on Benchmark Reliability)深度数理推导与工程落地解析
测试集内容出现在训练数据中使评测虚高;需 n-gram 重叠检测、成员推断、以及新测试集验证。
-
【AI 核心深度 M5-013】解释预训练数据的领域配比与退火阶段(annealing)的作用。(Pre-training Domain Mixtures and the Role of the Annealing Phase)深度数理推导与工程落地解析
领域配比决定能力分布;退火阶段在训练末尾用高质量/领域数据并降 lr,低成本地强化目标能力。
-
【AI 核心深度 M5-007】解释因果语言建模(CLM)与掩码语言建模(MLM)的差异。(Causal Language Modeling (CLM) vs. Masked Language Modeling (MLM))深度数理推导与工程落地解析
CLM 预测下一个 token(因果 mask,可生成);MLM 随机掩码预测被掩位置(双向,不能直接生成)。