Tag: applied-scientist
-
【AI 核心深度 M3-046】解释 One-Cycle / 循环学习率策略(The One-Cycle Policy and Cyclical Learning Rates: Mechanisms and Super-Convergence)深度数理推导与工程落地解析
让 lr 在一个周期内先升后降(呈三角/余弦),配合动量反向变化;可大幅缩短训练时间并提升精度。
-
【AI 核心深度 M3-047】列举深度学习中主要的正则化手段(Major Regularization Techniques in Deep Learning)深度数理推导与工程落地解析
数据增强、权重衰减、dropout、早停、label smoothing、噪声注入、集成/EMA、Mixup/CutMix 等,按’加先验’分类。
-
【AI 核心深度 M3-048】解释权重衰减为什么常与学习率解耦(Why Weight Decay is Decoupled from Learning Rate)深度数理推导与工程落地解析
L2 加在梯度里会被自适应 lr 缩放扭曲;解耦衰减直接在参数上乘 (1−ηλ),衰减率恒定可控(AdamW)。
-
【AI 核心深度 M3-049】什么是 Mixup 与 CutMix?为什么它们有效(Mixup and CutMix Data Augmentations: Mechanisms and Theoretical Foundations)深度数理推导与工程落地解析
Mixup 对样本与标签做线性插值;CutMix 用区域粘贴替换插值;两者都扩展数据分布、平滑决策边界。
-
【AI 核心深度 M3-034】什么是二阶优化与自然梯度?为什么深度学习不用它们(Second-Order Optimization and Natural Gradient Descent: Why Deep Learning Uses First-Order)深度数理推导与工程落地解析
二阶法用 Hessian(或其近似)预条件梯度;自然梯度用 Fisher 信息矩阵。精度高但每步成本 O(n²)~O(n³),深度网络不可行。
-
【AI 核心深度 M3-035】Adam 的偏差修正(bias correction)为什么必要?(Why Bias Correction is Mathematically Necessary in Adam)深度数理推导与工程落地解析
m、v 初始化为 0,早期 EWMA 被 0 拉低、严重低估真实矩;除以 (1−β^t) 修正。
-
【AI 核心深度 M3-022】Pre-LN 与 Post-LN 的区别是什么?为什么现代模型用 Pre-LN(Pre-LN vs Post-LN in Transformers: Structural Differences and Gradient Highway Stability)深度数理推导与工程落地解析
Post-LN 在残差后归一化(原版,深层不稳需 warmup);Pre-LN 在子层前归一化,梯度直通更稳。
-
【AI 核心深度 M3-023】解释 BatchNorm 在推理时为什么用 running 统计(Why BatchNorm Uses Running Statistics During Inference)深度数理推导与工程落地解析
推理时无 batch(或 batch=1),且需确定性输出;running 统计是训练期 batch 统计的滑动平均。
-
【AI 核心深度 M3-024】列举归一化层带来的副作用与替代方案(Side Effects of Normalization Layers and Alternative Architectures)深度数理推导与工程落地解析
副作用:依赖 batch(BN)、改变表示尺度、与 dropout 冲突、小 batch 不稳。替代:LN/GN/RMSNorm、Weight Standardization、Fixup。
-
【AI 核心深度 M3-025】解释 Group Normalization 与它适合的场景(Group Normalization (GN): Mechanism and Applicable Scenarios)深度数理推导与工程落地解析
把通道分组、在组内与空间维度归一化;与 batch 无关,适合小 batch 的检测/分割。