Tag: regularization-l1-l2
-
【AI 核心深度 M2-098】解释谱范数正则化与 Lipschitz 约束的关系(Spectral Norm Regularization and Lipschitz Continuity Constraints)深度数理推导与工程落地解析
谱范数 = 层的 Lipschitz 常数;约束谱范数即约束输出对输入的敏感度。
-
【AI 核心深度 M2-099】解释随机深度(Stochastic Depth / DropPath)与它与 Dropout 的差异(Stochastic Depth (DropPath) vs Standard Dropout: Mechanisms and Differences)深度数理推导与工程落地解析
训练时随机丢弃整个残差分支;推理时按概率缩放,与 BN 兼容性优于 dropout。
-
【AI 核心深度 M2-096】解释 L1 与 L2 正则化的贝叶斯解释(Bayesian Interpretation of L1 and L2 Regularization)深度数理推导与工程落地解析
L2 = 高斯先验下的 MAP;L1 = Laplace 先验下的 MAP;正则强度 = 先验方差的倒数。
-
【AI 核心深度 M2-097】解释权重衰减在 Adam 中为什么要解耦(AdamW)(Why Weight Decay Must Be Decoupled in Adam (AdamW))深度数理推导与工程落地解析
耦合时衰减被自适应学习率扭曲;解耦后衰减与学习率独立,正则效果更可预测。
-
【AI 核心深度 M2-012】正则化系数 λ 如何选择?过大过小分别会怎样。(Explain Hyperparameter Selection for Regularization Strength Lambda and Diagnostic Extremes)深度数理推导与工程落地解析
用交叉验证选择;λ 过大 → 欠拟合(高偏差),过小 → 过拟合(高方差)。
-
【AI 核心深度 M2-013】Dropout 为什么能起到正则化作用?给出两种解释。(Explain Why Dropout Acts as a Regularizer Through Ensemble and Feature Noise Perspectives)深度数理推导与工程落地解析
① 集成视角:等价于指数级子网络的 bagging;② 破坏共适应,迫使特征独立有用。
-
【AI 核心深度 M2-014】BatchNorm 为什么也有正则化效果?它和 Dropout 能一起用吗。(Explain the Regularization Effect of Batch Normalization and the Disharmony When Combined with Dropout)深度数理推导与工程落地解析
BN 引入 mini-batch 统计噪声,起轻微正则作用;但与 Dropout 同用会互相干扰(方差偏移)。
-
【AI 核心深度 M2-015】解释早停(early stopping)为什么等价于某种正则化。(Explain Why Early Stopping is Mathematically Equivalent to L2 Regularization)深度数理推导与工程落地解析
限制参数从初始点出发的’有效搜索半径’,与 L2 约束的可行域类似。
-
【AI 核心深度 M2-011】比较 L1、L2 与 ElasticNet 正则化的几何与效果差异。(Compare the Geometric and Functional Differences Between L1, L2, and ElasticNet Regularization)深度数理推导与工程落地解析
L1 稀疏(特征选择),L2 收缩(抗共线),ElasticNet 兼顾两者。