Tag: module-m3
-
【AI 核心深度 M3-063】解释为什么梯度噪声是隐式正则化(SGD 的泛化来源)(Why Stochastic Gradient Noise Acts as Implicit Regularization in SGD)深度数理推导与工程落地解析
梯度噪声使参数在极小值附近随机游走,偏好’噪声引起的 loss 上升小’的平坦解;噪声 ∝η/B,是隐式正则。
-
【AI 核心深度 M3-064】比较 MSE、MAE、Huber 损失(Comparing MSE, MAE, and Huber Loss: Robustness and Target Optimality)深度数理推导与工程落地解析
MSE 对大误差平方惩罚(对离群点敏感、梯度线性);MAE 线性惩罚(对离群点鲁棒、零点不可导);Huber 二者折中。
-
【AI 核心深度 M3-036】解释 Nesterov 动量与经典动量的差异(Nesterov Accelerated Gradient (NAG) vs Classical Momentum)深度数理推导与工程落地解析
经典动量先按当前梯度更新速度再走;Nesterov 先在’前瞻点’计算梯度再修正,收敛更快、震荡更小。
-
【AI 核心深度 M3-037】解释 Lion 优化器(符号动量)与它的特点(The Lion Optimizer: Sign Momentum, Memory Efficiency, and Behavioral Characteristics)深度数理推导与工程落地解析
Lion 只保留动量的符号作为更新方向,用符号一致性决定衰减;更省显存、更快,但需更小 lr 与更大权重衰减。
-
【AI 核心深度 M3-038】解释 Adafactor / 8-bit Adam 如何降低优化器显存(Memory-Efficient Optimizers: Adafactor and 8-bit Adam Explained)深度数理推导与工程落地解析
Adafactor 用梯度的行/列二阶矩低秩近似 v,省到 O(n/d);8-bit Adam 用量化+块缩放把状态压到 1/4。
-
【AI 核心深度 M3-039】比较 Adagrad / RMSProp / AdaDelta 的思想与 Adagrad 的缺陷(Comparing Adagrad, RMSProp, and AdaDelta: The Diminishing Learning Rate Problem)深度数理推导与工程落地解析
Adagrad 累积所有历史梯度平方(学习率单调衰减→后期停滞);RMSProp 用 EWMA 替代累积;AdaDelta 用参数更新量的 RMS 替代固定 lr。
-
【AI 核心深度 M3-040】为什么需要 warmup?(Why Learning Rate Warmup is Necessary in Deep Learning)深度数理推导与工程落地解析
初始参数与随机初始化下梯度方向噪声大、Adam 二阶矩估计不可靠;warmup 用小 lr 让统计量收敛,避免早期发散。
-
【AI 核心深度 M3-041】比较 cosine、step、linear、WSD 调度(Comparing Learning Rate Schedules: Cosine, Step, Linear, and WSD)深度数理推导与工程落地解析
cosine 平滑衰减到 0、step 分段下降、linear 线性衰减、WSD 先稳定后快速衰减;LLM 主流是 cosine 或 WSD。
-
【AI 核心深度 M3-042】学习率与 batch size 的关系是什么?线性缩放规则(Relationship Between Learning Rate and Batch Size: Linear vs Square-Root Scaling)深度数理推导与工程落地解析
lr 与 batch 近似成正比(线性缩放);但超过临界 batch 后收益饱和,改用 sqrt 缩放。
-
【AI 核心深度 M3-043】解释学习率预热的另一种动机:Adam 的二阶矩偏差(Alternative Motivation for Warmup: Adam’s Second-Moment Variance Collapse)深度数理推导与工程落地解析
Adam 的 v 是平方梯度的 EWMA,初期低估真实二阶矩,使有效步长偏大;warmup 等 v 收敛后再放大 lr。