Tag: module-m3
-
【AI 核心深度 M3-044】如何诊断学习率是否合适?(How to Diagnose Learning Rate Suitability: Signals, Metrics, and LR Range Tests)深度数理推导与工程落地解析
看 loss 曲线形态与梯度范数:lr 过大 → loss 震荡/爆炸;过小 → 下降缓慢且后期停滞;用 lr range test 定范围。
-
【AI 核心深度 M3-045】解释 WSD(warmup-stable-decay)调度为什么适合大模型预训练(Why Warmup-Stable-Decay (WSD) is Ideal for Large Language Model Pre-training)深度数理推导与工程落地解析
warmup 升温、stable 段恒定高 lr 长期探索、decay 段快速退火;stable 段可随时中断续训,decay 决定最终质量。
-
【AI 核心深度 M3-046】解释 One-Cycle / 循环学习率策略(The One-Cycle Policy and Cyclical Learning Rates: Mechanisms and Super-Convergence)深度数理推导与工程落地解析
让 lr 在一个周期内先升后降(呈三角/余弦),配合动量反向变化;可大幅缩短训练时间并提升精度。
-
【AI 核心深度 M3-047】列举深度学习中主要的正则化手段(Major Regularization Techniques in Deep Learning)深度数理推导与工程落地解析
数据增强、权重衰减、dropout、早停、label smoothing、噪声注入、集成/EMA、Mixup/CutMix 等,按’加先验’分类。
-
【AI 核心深度 M3-048】解释权重衰减为什么常与学习率解耦(Why Weight Decay is Decoupled from Learning Rate)深度数理推导与工程落地解析
L2 加在梯度里会被自适应 lr 缩放扭曲;解耦衰减直接在参数上乘 (1−ηλ),衰减率恒定可控(AdamW)。
-
【AI 核心深度 M3-049】什么是 Mixup 与 CutMix?为什么它们有效(Mixup and CutMix Data Augmentations: Mechanisms and Theoretical Foundations)深度数理推导与工程落地解析
Mixup 对样本与标签做线性插值;CutMix 用区域粘贴替换插值;两者都扩展数据分布、平滑决策边界。
-
【AI 核心深度 M3-034】什么是二阶优化与自然梯度?为什么深度学习不用它们(Second-Order Optimization and Natural Gradient Descent: Why Deep Learning Uses First-Order)深度数理推导与工程落地解析
二阶法用 Hessian(或其近似)预条件梯度;自然梯度用 Fisher 信息矩阵。精度高但每步成本 O(n²)~O(n³),深度网络不可行。
-
【AI 核心深度 M3-035】Adam 的偏差修正(bias correction)为什么必要?(Why Bias Correction is Mathematically Necessary in Adam)深度数理推导与工程落地解析
m、v 初始化为 0,早期 EWMA 被 0 拉低、严重低估真实矩;除以 (1−β^t) 修正。
-
【AI 核心深度 M3-022】Pre-LN 与 Post-LN 的区别是什么?为什么现代模型用 Pre-LN(Pre-LN vs Post-LN in Transformers: Structural Differences and Gradient Highway Stability)深度数理推导与工程落地解析
Post-LN 在残差后归一化(原版,深层不稳需 warmup);Pre-LN 在子层前归一化,梯度直通更稳。
-
【AI 核心深度 M3-023】解释 BatchNorm 在推理时为什么用 running 统计(Why BatchNorm Uses Running Statistics During Inference)深度数理推导与工程落地解析
推理时无 batch(或 batch=1),且需确定性输出;running 统计是训练期 batch 统计的滑动平均。