Tag: science-depth
-
【AI 核心深度 M3-036】解释 Nesterov 动量与经典动量的差异(Nesterov Accelerated Gradient (NAG) vs Classical Momentum)深度数理推导与工程落地解析
经典动量先按当前梯度更新速度再走;Nesterov 先在’前瞻点’计算梯度再修正,收敛更快、震荡更小。
-
【AI 核心深度 M3-037】解释 Lion 优化器(符号动量)与它的特点(The Lion Optimizer: Sign Momentum, Memory Efficiency, and Behavioral Characteristics)深度数理推导与工程落地解析
Lion 只保留动量的符号作为更新方向,用符号一致性决定衰减;更省显存、更快,但需更小 lr 与更大权重衰减。
-
【AI 核心深度 M3-038】解释 Adafactor / 8-bit Adam 如何降低优化器显存(Memory-Efficient Optimizers: Adafactor and 8-bit Adam Explained)深度数理推导与工程落地解析
Adafactor 用梯度的行/列二阶矩低秩近似 v,省到 O(n/d);8-bit Adam 用量化+块缩放把状态压到 1/4。
-
【AI 核心深度 M3-039】比较 Adagrad / RMSProp / AdaDelta 的思想与 Adagrad 的缺陷(Comparing Adagrad, RMSProp, and AdaDelta: The Diminishing Learning Rate Problem)深度数理推导与工程落地解析
Adagrad 累积所有历史梯度平方(学习率单调衰减→后期停滞);RMSProp 用 EWMA 替代累积;AdaDelta 用参数更新量的 RMS 替代固定 lr。
-
【AI 核心深度 M3-040】为什么需要 warmup?(Why Learning Rate Warmup is Necessary in Deep Learning)深度数理推导与工程落地解析
初始参数与随机初始化下梯度方向噪声大、Adam 二阶矩估计不可靠;warmup 用小 lr 让统计量收敛,避免早期发散。
-
【AI 核心深度 M3-041】比较 cosine、step、linear、WSD 调度(Comparing Learning Rate Schedules: Cosine, Step, Linear, and WSD)深度数理推导与工程落地解析
cosine 平滑衰减到 0、step 分段下降、linear 线性衰减、WSD 先稳定后快速衰减;LLM 主流是 cosine 或 WSD。
-
【AI 核心深度 M3-042】学习率与 batch size 的关系是什么?线性缩放规则(Relationship Between Learning Rate and Batch Size: Linear vs Square-Root Scaling)深度数理推导与工程落地解析
lr 与 batch 近似成正比(线性缩放);但超过临界 batch 后收益饱和,改用 sqrt 缩放。
-
【AI 核心深度 M3-043】解释学习率预热的另一种动机:Adam 的二阶矩偏差(Alternative Motivation for Warmup: Adam’s Second-Moment Variance Collapse)深度数理推导与工程落地解析
Adam 的 v 是平方梯度的 EWMA,初期低估真实二阶矩,使有效步长偏大;warmup 等 v 收敛后再放大 lr。
-
【AI 核心深度 M3-044】如何诊断学习率是否合适?(How to Diagnose Learning Rate Suitability: Signals, Metrics, and LR Range Tests)深度数理推导与工程落地解析
看 loss 曲线形态与梯度范数:lr 过大 → loss 震荡/爆炸;过小 → 下降缓慢且后期停滞;用 lr range test 定范围。
-
【AI 核心深度 M3-045】解释 WSD(warmup-stable-decay)调度为什么适合大模型预训练(Why Warmup-Stable-Decay (WSD) is Ideal for Large Language Model Pre-training)深度数理推导与工程落地解析
warmup 升温、stable 段恒定高 lr 长期探索、decay 段快速退火;stable 段可随时中断续训,decay 决定最终质量。