Tag: normalization-techniques
-
【AI 核心深度 M3-022】Pre-LN 与 Post-LN 的区别是什么?为什么现代模型用 Pre-LN(Pre-LN vs Post-LN in Transformers: Structural Differences and Gradient Highway Stability)深度数理推导与工程落地解析
Post-LN 在残差后归一化(原版,深层不稳需 warmup);Pre-LN 在子层前归一化,梯度直通更稳。
-
【AI 核心深度 M3-023】解释 BatchNorm 在推理时为什么用 running 统计(Why BatchNorm Uses Running Statistics During Inference)深度数理推导与工程落地解析
推理时无 batch(或 batch=1),且需确定性输出;running 统计是训练期 batch 统计的滑动平均。
-
【AI 核心深度 M3-024】列举归一化层带来的副作用与替代方案(Side Effects of Normalization Layers and Alternative Architectures)深度数理推导与工程落地解析
副作用:依赖 batch(BN)、改变表示尺度、与 dropout 冲突、小 batch 不稳。替代:LN/GN/RMSNorm、Weight Standardization、Fixup。
-
【AI 核心深度 M3-025】解释 Group Normalization 与它适合的场景(Group Normalization (GN): Mechanism and Applicable Scenarios)深度数理推导与工程落地解析
把通道分组、在组内与空间维度归一化;与 batch 无关,适合小 batch 的检测/分割。
-
【AI 核心深度 M3-026】解释 Weight Standardization 与它在无 BN 网络中的作用(Weight Standardization and Its Role in Normalizer-Free Networks)深度数理推导与工程落地解析
对权重矩阵做零均值单位方差标准化;改善优化条件,可与 GN 组合替代 BN。
-
【AI 核心深度 M3-027】解释 QK-Norm 与注意力中的归一化技术(QK-Norm and Normalization Techniques in Transformer Attention)深度数理推导与工程落地解析
对 attention 的 Q、K 做归一化,稳定 logits 尺度;现代 LLM(Gemma/Qwen)采用。
-
【AI 核心深度 M3-028】解释 DeepNorm 与它如何支持超深 Transformer(DeepNorm: Scaling Transformers to 1,000+ Layers with Theoretical Stability)深度数理推导与工程落地解析
Post-LN 的改进:放大残差(αx+F(x))并按深度缩放初始化;支持 1000 层。
-
【AI 核心深度 M3-029】解释归一化在推理期的算子融合与它对性能的影响(Normalization Operator Fusion in Inference and Its Impact on Serving Latency)深度数理推导与工程落地解析
把 LN/BN 折进相邻线性层或融合成单个内核,减少内存往返与启动开销。
-
【AI 核心深度 M3-020】比较 BatchNorm 与 LayerNorm 的归一化维度与适用场景(Comparing BatchNorm and LayerNorm: Normalization Dimensions and Applicable Regimes)深度数理推导与工程落地解析
BN 跨 batch 归一化(依赖 batch,CNN 常用);LN 跨特征归一化(与 batch 无关,Transformer/RNN 常用)。