Tag: module-m2
-
【AI 核心深度 M2-073】为什么不平衡数据下应优先看 PR-AUC 而不是 ROC-AUC?(Why Prioritize PR-AUC Over ROC-AUC in Highly Imbalanced Regimes?)深度数理推导与工程落地解析
ROC 的 FPR 分母是大量负样本,被稀释后曲线仍好看;PR 曲线对少数类更敏感。
-
【AI 核心深度 M2-074】如何选择分类阈值?不同业务目标下的策略(Classification Threshold Selection Strategies Across Diverse Business Objectives)深度数理推导与工程落地解析
按代价矩阵最小化期望损失,或按业务约束(召回下限)定阈值;用验证集选并考虑校准。
-
【AI 核心深度 M2-075】代价敏感学习如何实现?与重采样的关系(Cost-Sensitive Learning: Implementation and Relationship with Re-sampling)深度数理推导与工程落地解析
在损失中给不同类别不同权重;等价于按权重重采样(近似),但更稳定且不改变数据分布。
-
【AI 核心深度 M2-076】缺失值的三种机制是什么?分别该如何处理(Three Missing Data Mechanisms (MCAR, MAR, MNAR) and Treatment Strategies)深度数理推导与工程落地解析
MCAR(完全随机)、MAR(依赖可观测变量)、MNAR(依赖缺失值本身)。
-
【AI 核心深度 M2-077】比较均值/中位数插补、KNN 插补与多重插补(Comparing Mean/Median, KNN, and Multiple Imputation (MICE))深度数理推导与工程落地解析
简单插补快但低估方差;KNN 利用相似样本;多重插补(MICE)通过多次抽样反映不确定性。
-
【AI 核心深度 M2-078】什么时候应该加“缺失指示变量”?(When Should You Add a ‘Missing Indicator Variable’?)深度数理推导与工程落地解析
当缺失本身有信息(MNAR 或缺失与目标相关)时,指示变量能显著提升模型。
-
【AI 核心深度 M2-079】如何系统性排查数据泄漏?给出可操作的清单(How to Systematically Audit Data Leakage? An Actionable Checklist)深度数理推导与工程落地解析
按时间切分、把预处理放进 pipeline、检查特征可得时间、做特征-标签相关性审计、用随机标签测试。
-
【AI 核心深度 M2-080】为什么“先全量标准化再切分”是数据泄漏?如何修正(Why Global Normalization Before Splitting Causes Data Leakage and How to Fix It)深度数理推导与工程落地解析
标准化用到了验证/测试集的统计量,把未来信息带进训练;应只在训练集 fit、在验证集 transform。
-
【AI 核心深度 M2-081】定义模型校准,并解释为什么高准确率不等于好校准(Defining Model Calibration: Why High Accuracy Does Not Imply Good Calibration)深度数理推导与工程落地解析
校准指预测概率与真实频率一致;准确率高但概率系统性偏大/偏小仍是不校准。
-
【AI 核心深度 M2-082】比较 Platt scaling 与 Isotonic regression(Comparing Platt Scaling and Isotonic Regression for Probability Calibration)深度数理推导与工程落地解析
Platt 拟合 sigmoid(参数少、需较少数据);Isotonic 拟合单调阶梯(更灵活但易过拟合)。