Tag: module-m5
-
【AI 核心深度 M5-014】写出 Kaplan 与 Chinchilla 的核心结论。(Core Conclusions of Kaplan vs. Chinchilla Scaling Laws)深度数理推导与工程落地解析
Kaplan:损失随参数量/数据/算力幂律下降,参数优先;Chinchilla:参数量与数据量应同比例增长(约 20 token/参数)。
-
【AI 核心深度 M5-015】解释为什么推理成本改变了 scaling 的取舍。(Why Inference Costs Alter Compute-Optimal Scaling Choices)深度数理推导与工程落地解析
Chinchilla 只优化训练算力;若推理量大,’更多数据训练更小模型’(over-training)可降低总拥有成本。
-
【AI 核心深度 M5-016】解释涌现能力(emergence)与它的争议。(Emergent Abilities in Large Language Models and the Metric Discontinuity Debate)深度数理推导与工程落地解析
某些能力在小模型上接近随机、超过某规模后突然出现;但争议认为这是’指标不连续’造成的假象。
-
【AI 核心深度 M5-017】解释数据受限下的 scaling 策略。(Scaling Strategies Under Data-Constrained Regimes)深度数理推导与工程落地解析
高质量数据耗尽时,幂律失效;对策是数据高效方法(更好架构/优化)、合成数据、多轮 epoch 与退火。
-
【AI 核心深度 M5-018】解释 scaling law 对超参与架构选择的指导意义。(Guiding Hyperparameter and Architecture Choices via Scaling Laws)深度数理推导与工程落地解析
用小型实验拟合幂律预测大规模表现,指导 N/D 配比与超参(μP 使超参可迁移);但不能外推到新机制。
-
【AI 核心深度 M5-019】解释后训练阶段的 scaling(RL/推理算力)与预训练 scaling 的差异。(Post-Training Scaling (RL and Test-Time Compute) vs. Pre-Training Scaling)深度数理推导与工程落地解析
预训练 scaling 平滑可预测;RL/后训练的 scaling 更不稳定、更依赖任务与数据,且常呈’先快后慢’。
-
【AI 核心深度 M5-020】解释 SFT 的目标与数据构造要点。(Supervised Fine-Tuning (SFT) Objectives and Data Construction Principles)深度数理推导与工程落地解析
SFT 用(指令,回答)对做监督微调,教会模型’按指令作答’的格式与风格;数据需多样、高质量、格式一致。
-
【AI 核心深度 M5-021】解释损失掩码与序列打包(packing)的作用。(Loss Masking and Sequence Packing in SFT Training)深度数理推导与工程落地解析
损失掩码让损失只算在回答上;打包把多条短样本拼成定长序列以提高利用率,需用注意力隔离防跨样本泄漏。
-
【AI 核心深度 M5-022】解释 SFT 中的灾难性遗忘与缓解。(Catastrophic Forgetting in SFT and Mitigation Strategies)深度数理推导与工程落地解析
SFT 在小数据上微调会损害预训练的通用能力;用低 lr、少 epoch、混合通用数据、LoRA/正则缓解。
-
【AI 核心深度 M5-001】解释 BPE 算法,并说明它为什么被广泛使用。(BPE Algorithm and Why It Is Widely Used in LLMs)深度数理推导与工程落地解析
从字符开始,反复合并最高频的相邻符号对,直到达到目标词表;兼顾高频词整体化与未登录词可分解。