Tag: science-depth
-
【AI 核心深度 M2-119】解释超参调优的自动化工具与实践流程(Automated Hyperparameter Optimization Tools and Industrial Best-Practice Workflows)深度数理推导与工程落地解析
Optuna/Ray Tune 提供 TPE、Hyperband、ASHA 等算法;流程是分阶段(粗筛→精调)并按重要度排序。
-
【AI 核心深度 M3-001】解释计算图与自动微分的两种模式(前向/反向)(Computational Graphs and Two Automatic Differentiation Modes: Forward vs Reverse)深度数理推导与工程落地解析
前向模式算 JVP(输入维大时贵);反向模式算 VJP(输出维小时优,如标量损失)。
-
【AI 核心深度 M3-002】反向传播需要保存哪些中间量?如何省显存(Intermediate Quantities Retained for Backpropagation and Memory Optimization)深度数理推导与工程落地解析
需保存激活值与局部梯度;可用梯度检查点、混合精度、分片(FSDP)降低显存。
-
【AI 核心深度 M3-003】解释梯度累加(gradient accumulation),它等价于什么(Gradient Accumulation: Mathematical Equivalence and Implementation)深度数理推导与工程落地解析
多步前向反向累加梯度后再更新;等价于更大 batch,但 BN 统计仍按 micro-batch 计算。
-
【AI 核心深度 M3-004】什么是 in-place 操作对反向传播的风险?(Risks of In-Place Tensor Operations in Backpropagation)深度数理推导与工程落地解析
原地修改会覆盖反向所需的中间值,导致梯度错误或报错;框架用版本计数检测。
-
【AI 核心深度 M3-005】解释高阶导数的计算成本,以及什么时候需要它(Computational Cost of Higher-Order Derivatives and When They Are Needed)深度数理推导与工程落地解析
二阶导成本 O(n²) 内存;用于牛顿法、WGAN-GP 的梯度惩罚、MAML、可解释性(Hessian)。
-
【AI 核心深度 M3-006】什么是可微编程?它改变了哪些系统设计?(What is Differentiable Programming and How Does It Reshape System Design?)深度数理推导与工程落地解析
把’可学习组件’嵌入任意程序,端到端用梯度优化;使系统从’手写规则’转向’可学习管线’。
-
【AI 核心深度 M2-098】解释谱范数正则化与 Lipschitz 约束的关系(Spectral Norm Regularization and Lipschitz Continuity Constraints)深度数理推导与工程落地解析
谱范数 = 层的 Lipschitz 常数;约束谱范数即约束输出对输入的敏感度。
-
【AI 核心深度 M2-099】解释随机深度(Stochastic Depth / DropPath)与它与 Dropout 的差异(Stochastic Depth (DropPath) vs Standard Dropout: Mechanisms and Differences)深度数理推导与工程落地解析
训练时随机丢弃整个残差分支;推理时按概率缩放,与 BN 兼容性优于 dropout。
-
【AI 核心深度 M2-100】解释 AIC、BIC 与调整 R²,以及它们与交叉验证的关系(AIC, BIC, and Adjusted R-squared: Penalized Metrics vs Cross-Validation)深度数理推导与工程落地解析
信息准则 = 拟合优度 − 复杂度惩罚;AIC/BIC 用解析惩罚近似 CV,BIC 惩罚更强且有一致性。