Tag: optimizers-second-order-methods
-
【AI 核心深度 M3-036】解释 Nesterov 动量与经典动量的差异(Nesterov Accelerated Gradient (NAG) vs Classical Momentum)深度数理推导与工程落地解析
经典动量先按当前梯度更新速度再走;Nesterov 先在’前瞻点’计算梯度再修正,收敛更快、震荡更小。
-
【AI 核心深度 M3-037】解释 Lion 优化器(符号动量)与它的特点(The Lion Optimizer: Sign Momentum, Memory Efficiency, and Behavioral Characteristics)深度数理推导与工程落地解析
Lion 只保留动量的符号作为更新方向,用符号一致性决定衰减;更省显存、更快,但需更小 lr 与更大权重衰减。
-
【AI 核心深度 M3-038】解释 Adafactor / 8-bit Adam 如何降低优化器显存(Memory-Efficient Optimizers: Adafactor and 8-bit Adam Explained)深度数理推导与工程落地解析
Adafactor 用梯度的行/列二阶矩低秩近似 v,省到 O(n/d);8-bit Adam 用量化+块缩放把状态压到 1/4。
-
【AI 核心深度 M3-039】比较 Adagrad / RMSProp / AdaDelta 的思想与 Adagrad 的缺陷(Comparing Adagrad, RMSProp, and AdaDelta: The Diminishing Learning Rate Problem)深度数理推导与工程落地解析
Adagrad 累积所有历史梯度平方(学习率单调衰减→后期停滞);RMSProp 用 EWMA 替代累积;AdaDelta 用参数更新量的 RMS 替代固定 lr。
-
【AI 核心深度 M3-034】什么是二阶优化与自然梯度?为什么深度学习不用它们(Second-Order Optimization and Natural Gradient Descent: Why Deep Learning Uses First-Order)深度数理推导与工程落地解析
二阶法用 Hessian(或其近似)预条件梯度;自然梯度用 Fisher 信息矩阵。精度高但每步成本 O(n²)~O(n³),深度网络不可行。
-
【AI 核心深度 M3-035】Adam 的偏差修正(bias correction)为什么必要?(Why Bias Correction is Mathematically Necessary in Adam)深度数理推导与工程落地解析
m、v 初始化为 0,早期 EWMA 被 0 拉低、严重低估真实矩;除以 (1−β^t) 修正。
-
【AI 核心深度 M3-030】写出 SGD、Momentum、Adam 的更新式(Update Formulas for SGD, SGD with Momentum, and Adam)深度数理推导与工程落地解析
SGD 只用一阶梯度;Momentum 累积历史梯度形成速度;Adam 同时用一阶矩(动量)与二阶矩(自适应步长)。
-
【AI 核心深度 M3-031】Adam 与 AdamW 的区别是什么?为什么 AdamW 更正确(Adam vs AdamW: Structural Differences and Why AdamW is Mathematically Correct)深度数理推导与工程落地解析
Adam 把 L2 正则混入梯度(等价于用自适应 lr 缩放的正则);AdamW 解耦权重衰减,直接在参数上乘衰减因子。
-
【AI 核心深度 M3-032】解释 Adam 的 ε 参数作用,以及它在大模型中的常见取值(Role of the Epsilon Parameter in Adam and Common Settings in Large Models)深度数理推导与工程落地解析
ε 防止 v̂ 为 0 时除零,同时在下界约束步长上界(η/ε);LLM 常用 1e-8,某些低精度训练用 1e-6。
-
【AI 核心深度 M3-033】比较 SGD+Momentum 与 Adam 的泛化差异(Generalization Differences: SGD with Momentum vs Adam)深度数理推导与工程落地解析
SGD 通常泛化更好(更平的极小值、更强隐式正则);Adam 收敛更快但可能过拟合;大模型因规模与稳定性选 Adam。