Tag: module-m2
-
【AI 核心深度 M2-031】什么是 Stacking?它与 Blending 的区别是什么。(Define Stacking vs. Blending in Heterogeneous Ensembles and Compare Their Information Leakage Safeguards)深度数理推导与工程落地解析
Stacking 用元学习器组合基模型输出(交叉验证生成元特征);Blending 用固定留出集,简单但数据利用低。
-
【AI 核心深度 M2-032】解释 GBDT 的核心思想:为什么是’拟合负梯度’。(Explain the Core Concept of GBDT: Why Sequential Trees Fit the Negative Gradient)深度数理推导与工程落地解析
每轮拟合当前模型损失函数的负梯度(伪残差),等价于在函数空间做梯度下降。
-
【AI 核心深度 M2-012】正则化系数 λ 如何选择?过大过小分别会怎样。(Explain Hyperparameter Selection for Regularization Strength Lambda and Diagnostic Extremes)深度数理推导与工程落地解析
用交叉验证选择;λ 过大 → 欠拟合(高偏差),过小 → 过拟合(高方差)。
-
【AI 核心深度 M2-013】Dropout 为什么能起到正则化作用?给出两种解释。(Explain Why Dropout Acts as a Regularizer Through Ensemble and Feature Noise Perspectives)深度数理推导与工程落地解析
① 集成视角:等价于指数级子网络的 bagging;② 破坏共适应,迫使特征独立有用。
-
【AI 核心深度 M2-014】BatchNorm 为什么也有正则化效果?它和 Dropout 能一起用吗。(Explain the Regularization Effect of Batch Normalization and the Disharmony When Combined with Dropout)深度数理推导与工程落地解析
BN 引入 mini-batch 统计噪声,起轻微正则作用;但与 Dropout 同用会互相干扰(方差偏移)。
-
【AI 核心深度 M2-015】解释早停(early stopping)为什么等价于某种正则化。(Explain Why Early Stopping is Mathematically Equivalent to L2 Regularization)深度数理推导与工程落地解析
限制参数从初始点出发的’有效搜索半径’,与 L2 约束的可行域类似。
-
【AI 核心深度 M2-017】如何用学习曲线诊断高偏差与高方差?(Detail How to Diagnose High Bias vs. High Variance Using Learning Curves and Remediation Strategies)深度数理推导与工程落地解析
训练与验证误差都高且接近 → 高偏差;训练低、验证高且差距大 → 高方差。