Tag: module-m2
-
【AI 核心深度 M2-110】解释 GBDT 的早停与最优迭代数的确定(Early Stopping in GBDT and Determining the Optimal Number of Iterations)深度数理推导与工程落地解析
用验证集监控,在指标不再改善时停止;早停同时是正则化与效率优化。
-
【AI 核心深度 M2-111】解释 GBDT 的特征重要度与 SHAP 值的差异(Differences Between GBDT Built-in Feature Importance and TreeSHAP Values)深度数理推导与工程落地解析
MDI 基于不纯度下降(快但偏向高基数);SHAP 基于博弈论(一致、逐样本,但计算贵)。
-
【AI 核心深度 M2-093】解释回归中的交互项与多项式项,以及如何避免过拟合(Interaction and Polynomial Terms in Regression: Formulations and Regularization)深度数理推导与工程落地解析
交互项捕捉’一个特征的效应依赖另一特征’;多项式项捕捉非线性;需标准化与正则化。
-
【AI 核心深度 M2-094】解释多项逻辑回归(softmax 回归)与它的参数辨识性问题(Multinomial Logistic Regression (Softmax Regression) and Parameter Identifiability)深度数理推导与工程落地解析
用 softmax 输出 K 类概率;K 组参数不可唯一辨识,需固定参照类或加约束。
-
【AI 核心深度 M2-095】解释逻辑回归与最大熵模型的关系(Relationship Between Logistic Regression and the Maximum Entropy Model)深度数理推导与工程落地解析
在给定特征期望约束下,最大熵解的形式恰是逻辑回归;两者是同一模型的不同推导路径。
-
【AI 核心深度 M2-096】解释 L1 与 L2 正则化的贝叶斯解释(Bayesian Interpretation of L1 and L2 Regularization)深度数理推导与工程落地解析
L2 = 高斯先验下的 MAP;L1 = Laplace 先验下的 MAP;正则强度 = 先验方差的倒数。
-
【AI 核心深度 M2-097】解释权重衰减在 Adam 中为什么要解耦(AdamW)(Why Weight Decay Must Be Decoupled in Adam (AdamW))深度数理推导与工程落地解析
耦合时衰减被自适应学习率扭曲;解耦后衰减与学习率独立,正则效果更可预测。
-
【AI 核心深度 M2-084】温度缩放(temperature scaling)如何校准深度网络?(Temperature Scaling for Calibrating Deep Neural Networks)深度数理推导与工程落地解析
在 logits 上除以温度 T,用验证集拟合 T;不改预测类别,只调整置信度。
-
【AI 核心深度 M2-085】校准在哪些场景至关重要?举两个例子(Scenarios Where Calibration is Critical: Core Use Cases and Concrete Examples)深度数理推导与工程落地解析
概率被下游使用时:医疗风险、金融定价、广告出价、级联系统的阈值决策。
-
【AI 核心深度 M2-086】列举分类、回归、排序的常用评估指标(Common Evaluation Metrics for Classification, Regression, and Ranking)深度数理推导与工程落地解析
分类:Accuracy/P/R/F1/AUC/PR-AUC/LogLoss;回归:MSE/MAE/RMSE/R²/分位数损失;排序:NDCG/MRR/MAP/Recall@K。