Tag: weight-initialization
-
【AI 核心深度 M3-008】为什么不能全零初始化?(Why All-Zero Weight Initialization Fails in Neural Networks)深度数理推导与工程落地解析
对称性无法打破:同层神经元梯度相同、永远学出相同权重。
-
【AI 核心深度 M3-009】写出 Xavier 与 Kaiming 初始化的方差,并说明适用激活(Xavier and Kaiming Initialization: Mathematical Variances and Suitable Activations)深度数理推导与工程落地解析
Xavier 适合 tanh/sigmoid,Kaiming 适合 ReLU(考虑半区激活)。
-
【AI 核心深度 M3-010】解释“方差保持”原则,以及它与梯度稳定的关系(The ‘Variance Preservation’ Principle and Its Relation to Gradient Stability)深度数理推导与工程落地解析
若每层输出方差被放大或缩小,深层会指数爆炸/衰减;保持方差≈1 使梯度尺度稳定。
-
【AI 核心深度 M3-011】Transformer 中常见的初始化技巧有哪些?(Common Initialization Techniques in Transformers)深度数理推导与工程落地解析
缩放初始化(除以 √(2L))、残差分支小初始化、LayerNorm 前零初始化、输出投影零初始化。
-
【AI 核心深度 M3-012】什么是 μP(最大更新参数化)?它解决什么问题(Maximal Update Parametrization (μP): Concepts and Hyperparameter Transfer)深度数理推导与工程落地解析
按宽度调整初始化与学习率,使最优超参在不同宽度下可迁移(超参迁移)。