Tag: module-m3
-
【AI 核心深度 M3-024】列举归一化层带来的副作用与替代方案(Side Effects of Normalization Layers and Alternative Architectures)深度数理推导与工程落地解析
副作用:依赖 batch(BN)、改变表示尺度、与 dropout 冲突、小 batch 不稳。替代:LN/GN/RMSNorm、Weight Standardization、Fixup。
-
【AI 核心深度 M3-025】解释 Group Normalization 与它适合的场景(Group Normalization (GN): Mechanism and Applicable Scenarios)深度数理推导与工程落地解析
把通道分组、在组内与空间维度归一化;与 batch 无关,适合小 batch 的检测/分割。
-
【AI 核心深度 M3-026】解释 Weight Standardization 与它在无 BN 网络中的作用(Weight Standardization and Its Role in Normalizer-Free Networks)深度数理推导与工程落地解析
对权重矩阵做零均值单位方差标准化;改善优化条件,可与 GN 组合替代 BN。
-
【AI 核心深度 M3-027】解释 QK-Norm 与注意力中的归一化技术(QK-Norm and Normalization Techniques in Transformer Attention)深度数理推导与工程落地解析
对 attention 的 Q、K 做归一化,稳定 logits 尺度;现代 LLM(Gemma/Qwen)采用。
-
【AI 核心深度 M3-028】解释 DeepNorm 与它如何支持超深 Transformer(DeepNorm: Scaling Transformers to 1,000+ Layers with Theoretical Stability)深度数理推导与工程落地解析
Post-LN 的改进:放大残差(αx+F(x))并按深度缩放初始化;支持 1000 层。
-
【AI 核心深度 M3-029】解释归一化在推理期的算子融合与它对性能的影响(Normalization Operator Fusion in Inference and Its Impact on Serving Latency)深度数理推导与工程落地解析
把 LN/BN 折进相邻线性层或融合成单个内核,减少内存往返与启动开销。
-
【AI 核心深度 M3-030】写出 SGD、Momentum、Adam 的更新式(Update Formulas for SGD, SGD with Momentum, and Adam)深度数理推导与工程落地解析
SGD 只用一阶梯度;Momentum 累积历史梯度形成速度;Adam 同时用一阶矩(动量)与二阶矩(自适应步长)。
-
【AI 核心深度 M3-031】Adam 与 AdamW 的区别是什么?为什么 AdamW 更正确(Adam vs AdamW: Structural Differences and Why AdamW is Mathematically Correct)深度数理推导与工程落地解析
Adam 把 L2 正则混入梯度(等价于用自适应 lr 缩放的正则);AdamW 解耦权重衰减,直接在参数上乘衰减因子。
-
【AI 核心深度 M3-032】解释 Adam 的 ε 参数作用,以及它在大模型中的常见取值(Role of the Epsilon Parameter in Adam and Common Settings in Large Models)深度数理推导与工程落地解析
ε 防止 v̂ 为 0 时除零,同时在下界约束步长上界(η/ε);LLM 常用 1e-8,某些低精度训练用 1e-6。
-
【AI 核心深度 M3-033】比较 SGD+Momentum 与 Adam 的泛化差异(Generalization Differences: SGD with Momentum vs Adam)深度数理推导与工程落地解析
SGD 通常泛化更好(更平的极小值、更强隐式正则);Adam 收敛更快但可能过拟合;大模型因规模与稳定性选 Adam。