Tag: module-m3
-
【AI 核心深度 M3-017】激活函数的选择如何影响数值稳定性与训练速度?(How Activation Function Choice Impacts Numerical Stability and Training Speed)深度数理推导与工程落地解析
饱和函数数值不稳(梯度消失 + exp 溢出);分段/平滑函数更快;注意 FP16 下的溢出区间。
-
【AI 核心深度 M3-018】激活函数的平滑性如何影响量化(INT8/INT4)推理的精度?(How Activation Smoothness Impacts INT8/INT4 Quantization Accuracy)深度数理推导与工程落地解析
ReLU 有精确零点、分段线性,量化友好;GELU/SiLU 平滑且分布连续,量化误差更大,需逐 token 动态量化或保留高精度。
-
【AI 核心深度 M3-019】GELU 与 SiLU 的区别与联系?各自被哪些模型采用?(GELU vs SiLU: Differences, Connections, and Industry Model Adoption)深度数理推导与工程落地解析
两者都是平滑非单调激活;GELU 用高斯 CDF 门控、SiLU 用 sigmoid 门控;BERT/GPT-2 用 GELU,LLaMA/PaLM 用 SiLU(SwiGLU)。
-
【AI 核心深度 M3-020】比较 BatchNorm 与 LayerNorm 的归一化维度与适用场景(Comparing BatchNorm and LayerNorm: Normalization Dimensions and Applicable Regimes)深度数理推导与工程落地解析
BN 跨 batch 归一化(依赖 batch,CNN 常用);LN 跨特征归一化(与 batch 无关,Transformer/RNN 常用)。
-
【AI 核心深度 M3-001】解释计算图与自动微分的两种模式(前向/反向)(Computational Graphs and Two Automatic Differentiation Modes: Forward vs Reverse)深度数理推导与工程落地解析
前向模式算 JVP(输入维大时贵);反向模式算 VJP(输出维小时优,如标量损失)。
-
【AI 核心深度 M3-002】反向传播需要保存哪些中间量?如何省显存(Intermediate Quantities Retained for Backpropagation and Memory Optimization)深度数理推导与工程落地解析
需保存激活值与局部梯度;可用梯度检查点、混合精度、分片(FSDP)降低显存。
-
【AI 核心深度 M3-003】解释梯度累加(gradient accumulation),它等价于什么(Gradient Accumulation: Mathematical Equivalence and Implementation)深度数理推导与工程落地解析
多步前向反向累加梯度后再更新;等价于更大 batch,但 BN 统计仍按 micro-batch 计算。
-
【AI 核心深度 M3-004】什么是 in-place 操作对反向传播的风险?(Risks of In-Place Tensor Operations in Backpropagation)深度数理推导与工程落地解析
原地修改会覆盖反向所需的中间值,导致梯度错误或报错;框架用版本计数检测。
-
【AI 核心深度 M3-005】解释高阶导数的计算成本,以及什么时候需要它(Computational Cost of Higher-Order Derivatives and When They Are Needed)深度数理推导与工程落地解析
二阶导成本 O(n²) 内存;用于牛顿法、WGAN-GP 的梯度惩罚、MAML、可解释性(Hessian)。