Tag: gradient-vanishing-explosion
-
【AI 核心深度 M3-054】解释梯度消失与爆炸的成因与缓解(Vanishing and Exploding Gradients: Root Causes, Dynamics, and Modern Mitigations)深度数理推导与工程落地解析
深层链式相乘使梯度按层数指数衰减/放大;用残差、归一化、合理初始化、门控(LSTM)与梯度裁剪缓解。
-
【AI 核心深度 M3-055】解释梯度裁剪的两种方式(by norm / by value)的差异(Gradient Clipping: Clip-by-Norm vs Clip-by-Value Differences and Geometry)深度数理推导与工程落地解析
by value 逐元素截断到 [−c,c],会改变梯度方向;by norm 按全局范数等比缩放,保持方向不变。
-
【AI 核心深度 M3-056】什么是梯度噪声尺度?它与 batch size 的关系(Gradient Noise Scale ($B^*$): Definition and Its Relationship to Optimal Batch Size)深度数理推导与工程落地解析
梯度噪声尺度 g=tr(Σ)/|G|² 衡量噪声与信号的比;它随 batch 增大而下降(∝1/B),决定临界 batch。
-
【AI 核心深度 M3-057】如何检测与定位梯度异常?(How to Detect and Isolate Gradient Anomalies: Diagnostic Signals and Workflows)深度数理推导与工程落地解析
逐层记录梯度范数、更新范数与参数范数;查单调衰减(消失)、尖峰(爆炸)、层间失衡与 dead 单元。
-
【AI 核心深度 M3-058】解释“梯度冲突”与多任务学习中的处理(Gradient Conflict in Multi-Task Learning and Remediation Techniques)深度数理推导与工程落地解析
不同任务的梯度方向可能相反(余弦相似度<0),直接求和会相互抵消;用 PCGrad、GradNorm、不确定性加权等处理。
-
【AI 核心深度 M3-059】解释残差连接与归一化如何共同保证梯度流(How Residual Connections and Normalization Cooperate to Guarantee Gradient Flow)深度数理推导与工程落地解析
残差提供恒等直通路径(Jacobian 含 I),归一化稳定每层输入分布;两者合起来使深层网络的梯度尺度不随深度衰减。
-
【AI 核心深度 M3-060】解释 loss spike 现象与梯度范数的关系及缓解(The Loss Spike Phenomenon: Gradient Norm Correlations, Root Causes, and Mitigations)深度数理推导与工程落地解析
训练中 loss 突然上升(常伴 grad_norm 尖峰),多由特定数据批次或数值问题引起;用回滚、跳过批次、降 lr、裁剪缓解。
-
【AI 核心深度 M3-061】解释 embedding 与输出层的梯度尺度问题(logit 缩放)(Gradient Scale Mismatch in Embedding and Output Layers: Logit Scaling and Tying)深度数理推导与工程落地解析
输出层 logit 随隐藏维度增大而增大,导致 softmax 梯度饱和、embedding 梯度失衡;用 logit 缩放/μP 修正。
-
【AI 核心深度 M3-062】解释 per-layer / adaptive 梯度裁剪(AGC)(Per-Layer and Adaptive Gradient Clipping (AGC) Explained)深度数理推导与工程落地解析
逐层按’梯度范数 / 参数范数’的比值裁剪,自适应各层尺度;比全局裁剪更能处理层间梯度失衡。
-
【AI 核心深度 M3-063】解释为什么梯度噪声是隐式正则化(SGD 的泛化来源)(Why Stochastic Gradient Noise Acts as Implicit Regularization in SGD)深度数理推导与工程落地解析
梯度噪声使参数在极小值附近随机游走,偏好’噪声引起的 loss 上升小’的平坦解;噪声 ∝η/B,是隐式正则。