Tag: regularization-training-tricks
-
【AI 核心深度 M3-050】解释 EMA(指数移动平均)在训练中的作用(The Role of Exponential Moving Average (EMA) of Weights in Training)深度数理推导与工程落地解析
对参数做 EWMA 得到平滑权重,推理用 EMA 权重;降低参数噪声、提升泛化与稳定性,近似模型集成。
-
【AI 核心深度 M3-051】什么是参数平均(SWA)与模型融合?(Stochastic Weight Averaging (SWA) and Weight Ensembling (Model Soups))深度数理推导与工程落地解析
SWA 对轨迹上多点做等权平均,偏向平坦解;模型融合(checkpoint averaging / 集成)平均多个模型的预测或权重。
-
【AI 核心深度 M3-052】解释 label smoothing 的作用与代价(Label Smoothing: Role, Mathematical Mechanism, and Hidden Costs)深度数理推导与工程落地解析
把硬标签替换为软标签(正确类 1−ε、其余 ε/(K−1));抑制过度自信、改善校准,但损失可解释性与蒸馏能力。
-
【AI 核心深度 M3-053】解释 dropout 在 Transformer / LLM 中的使用差异(Dropout Usage in Transformers and LLMs: Differences Across Modalities and Scales)深度数理推导与工程落地解析
小模型/CV/微调用 dropout(0.1);大 LLM 预训练几乎不用(数据充足、显存开销大、与 LN 功能重叠)。
-
【AI 核心深度 M3-047】列举深度学习中主要的正则化手段(Major Regularization Techniques in Deep Learning)深度数理推导与工程落地解析
数据增强、权重衰减、dropout、早停、label smoothing、噪声注入、集成/EMA、Mixup/CutMix 等,按’加先验’分类。
-
【AI 核心深度 M3-048】解释权重衰减为什么常与学习率解耦(Why Weight Decay is Decoupled from Learning Rate)深度数理推导与工程落地解析
L2 加在梯度里会被自适应 lr 缩放扭曲;解耦衰减直接在参数上乘 (1−ηλ),衰减率恒定可控(AdamW)。
-
【AI 核心深度 M3-049】什么是 Mixup 与 CutMix?为什么它们有效(Mixup and CutMix Data Augmentations: Mechanisms and Theoretical Foundations)深度数理推导与工程落地解析
Mixup 对样本与标签做线性插值;CutMix 用区域粘贴替换插值;两者都扩展数据分布、平滑决策边界。