Tag: backprop-autodiff
-
【AI 核心深度 M3-007】解释梯度检验(gradient checking)的原理与实现细节(Gradient Checking: Principles, Finite Differences, and Implementation Details)深度数理推导与工程落地解析
用有限差分近似数值梯度,与解析梯度比对;关键是中心差分、相对误差判据与 double 精度。
-
【AI 核心深度 M3-001】解释计算图与自动微分的两种模式(前向/反向)(Computational Graphs and Two Automatic Differentiation Modes: Forward vs Reverse)深度数理推导与工程落地解析
前向模式算 JVP(输入维大时贵);反向模式算 VJP(输出维小时优,如标量损失)。
-
【AI 核心深度 M3-002】反向传播需要保存哪些中间量?如何省显存(Intermediate Quantities Retained for Backpropagation and Memory Optimization)深度数理推导与工程落地解析
需保存激活值与局部梯度;可用梯度检查点、混合精度、分片(FSDP)降低显存。
-
【AI 核心深度 M3-003】解释梯度累加(gradient accumulation),它等价于什么(Gradient Accumulation: Mathematical Equivalence and Implementation)深度数理推导与工程落地解析
多步前向反向累加梯度后再更新;等价于更大 batch,但 BN 统计仍按 micro-batch 计算。
-
【AI 核心深度 M3-004】什么是 in-place 操作对反向传播的风险?(Risks of In-Place Tensor Operations in Backpropagation)深度数理推导与工程落地解析
原地修改会覆盖反向所需的中间值,导致梯度错误或报错;框架用版本计数检测。
-
【AI 核心深度 M3-005】解释高阶导数的计算成本,以及什么时候需要它(Computational Cost of Higher-Order Derivatives and When They Are Needed)深度数理推导与工程落地解析
二阶导成本 O(n²) 内存;用于牛顿法、WGAN-GP 的梯度惩罚、MAML、可解释性(Hessian)。
-
【AI 核心深度 M3-006】什么是可微编程?它改变了哪些系统设计?(What is Differentiable Programming and How Does It Reshape System Design?)深度数理推导与工程落地解析
把’可学习组件’嵌入任意程序,端到端用梯度优化;使系统从’手写规则’转向’可学习管线’。