Tag: scaling-laws-compute-allocation
-
【AI 核心深度 M5-014】写出 Kaplan 与 Chinchilla 的核心结论。(Core Conclusions of Kaplan vs. Chinchilla Scaling Laws)深度数理推导与工程落地解析
Kaplan:损失随参数量/数据/算力幂律下降,参数优先;Chinchilla:参数量与数据量应同比例增长(约 20 token/参数)。
-
【AI 核心深度 M5-015】解释为什么推理成本改变了 scaling 的取舍。(Why Inference Costs Alter Compute-Optimal Scaling Choices)深度数理推导与工程落地解析
Chinchilla 只优化训练算力;若推理量大,’更多数据训练更小模型’(over-training)可降低总拥有成本。
-
【AI 核心深度 M5-016】解释涌现能力(emergence)与它的争议。(Emergent Abilities in Large Language Models and the Metric Discontinuity Debate)深度数理推导与工程落地解析
某些能力在小模型上接近随机、超过某规模后突然出现;但争议认为这是’指标不连续’造成的假象。
-
【AI 核心深度 M5-017】解释数据受限下的 scaling 策略。(Scaling Strategies Under Data-Constrained Regimes)深度数理推导与工程落地解析
高质量数据耗尽时,幂律失效;对策是数据高效方法(更好架构/优化)、合成数据、多轮 epoch 与退火。
-
【AI 核心深度 M5-018】解释 scaling law 对超参与架构选择的指导意义。(Guiding Hyperparameter and Architecture Choices via Scaling Laws)深度数理推导与工程落地解析
用小型实验拟合幂律预测大规模表现,指导 N/D 配比与超参(μP 使超参可迁移);但不能外推到新机制。
-
【AI 核心深度 M5-019】解释后训练阶段的 scaling(RL/推理算力)与预训练 scaling 的差异。(Post-Training Scaling (RL and Test-Time Compute) vs. Pre-Training Scaling)深度数理推导与工程落地解析
预训练 scaling 平滑可预测;RL/后训练的 scaling 更不稳定、更依赖任务与数据,且常呈’先快后慢’。