Tag: machine-learning
-
【AI 核心深度 M2-118】解释多指标权衡与综合指标(OEC)的设计(Multi-Metric Trade-offs and Designing an Overall Evaluation Criterion (OEC))深度数理推导与工程落地解析
单一综合指标(OEC)便于决策但会掩盖局部;需配合护栏指标与分层分析。
-
【AI 核心深度 M2-119】解释超参调优的自动化工具与实践流程(Automated Hyperparameter Optimization Tools and Industrial Best-Practice Workflows)深度数理推导与工程落地解析
Optuna/Ray Tune 提供 TPE、Hyperband、ASHA 等算法;流程是分阶段(粗筛→精调)并按重要度排序。
-
【AI 核心深度 M3-001】解释计算图与自动微分的两种模式(前向/反向)(Computational Graphs and Two Automatic Differentiation Modes: Forward vs Reverse)深度数理推导与工程落地解析
前向模式算 JVP(输入维大时贵);反向模式算 VJP(输出维小时优,如标量损失)。
-
【AI 核心深度 M3-002】反向传播需要保存哪些中间量?如何省显存(Intermediate Quantities Retained for Backpropagation and Memory Optimization)深度数理推导与工程落地解析
需保存激活值与局部梯度;可用梯度检查点、混合精度、分片(FSDP)降低显存。
-
【AI 核心深度 M3-003】解释梯度累加(gradient accumulation),它等价于什么(Gradient Accumulation: Mathematical Equivalence and Implementation)深度数理推导与工程落地解析
多步前向反向累加梯度后再更新;等价于更大 batch,但 BN 统计仍按 micro-batch 计算。
-
【AI 核心深度 M3-004】什么是 in-place 操作对反向传播的风险?(Risks of In-Place Tensor Operations in Backpropagation)深度数理推导与工程落地解析
原地修改会覆盖反向所需的中间值,导致梯度错误或报错;框架用版本计数检测。
-
【AI 核心深度 M3-005】解释高阶导数的计算成本,以及什么时候需要它(Computational Cost of Higher-Order Derivatives and When They Are Needed)深度数理推导与工程落地解析
二阶导成本 O(n²) 内存;用于牛顿法、WGAN-GP 的梯度惩罚、MAML、可解释性(Hessian)。
-
【AI 核心深度 M3-006】什么是可微编程?它改变了哪些系统设计?(What is Differentiable Programming and How Does It Reshape System Design?)深度数理推导与工程落地解析
把’可学习组件’嵌入任意程序,端到端用梯度优化;使系统从’手写规则’转向’可学习管线’。
-
【AI 核心深度 M2-098】解释谱范数正则化与 Lipschitz 约束的关系(Spectral Norm Regularization and Lipschitz Continuity Constraints)深度数理推导与工程落地解析
谱范数 = 层的 Lipschitz 常数;约束谱范数即约束输出对输入的敏感度。
-
【AI 核心深度 M2-099】解释随机深度(Stochastic Depth / DropPath)与它与 Dropout 的差异(Stochastic Depth (DropPath) vs Standard Dropout: Mechanisms and Differences)深度数理推导与工程落地解析
训练时随机丢弃整个残差分支;推理时按概率缩放,与 BN 兼容性优于 dropout。