Tag: missing-values-data-leakage
-
【AI 核心深度 M2-116】解释 MICE(多重插补链式方程)的迭代过程与实现要点(MICE (Multiple Imputation by Chained Equations): Iterative Process and Key Details)深度数理推导与工程落地解析
对每个缺失特征用其他特征回归预测,循环迭代;每次抽取多个候选值生成 M 个完整数据集。
-
【AI 核心深度 M2-117】解释时间序列与面板数据中的泄漏防范要点(Preventing Data Leakage in Time Series and Panel Data: Critical Safeguards)深度数理推导与工程落地解析
严格时间切分、滚动特征右开区间、按实体分组、避免全量统计量;泄漏最隐蔽也最致命。
-
【AI 核心深度 M2-076】缺失值的三种机制是什么?分别该如何处理(Three Missing Data Mechanisms (MCAR, MAR, MNAR) and Treatment Strategies)深度数理推导与工程落地解析
MCAR(完全随机)、MAR(依赖可观测变量)、MNAR(依赖缺失值本身)。
-
【AI 核心深度 M2-077】比较均值/中位数插补、KNN 插补与多重插补(Comparing Mean/Median, KNN, and Multiple Imputation (MICE))深度数理推导与工程落地解析
简单插补快但低估方差;KNN 利用相似样本;多重插补(MICE)通过多次抽样反映不确定性。
-
【AI 核心深度 M2-078】什么时候应该加“缺失指示变量”?(When Should You Add a ‘Missing Indicator Variable’?)深度数理推导与工程落地解析
当缺失本身有信息(MNAR 或缺失与目标相关)时,指示变量能显著提升模型。
-
【AI 核心深度 M2-079】如何系统性排查数据泄漏?给出可操作的清单(How to Systematically Audit Data Leakage? An Actionable Checklist)深度数理推导与工程落地解析
按时间切分、把预处理放进 pipeline、检查特征可得时间、做特征-标签相关性审计、用随机标签测试。
-
【AI 核心深度 M2-080】为什么“先全量标准化再切分”是数据泄漏?如何修正(Why Global Normalization Before Splitting Causes Data Leakage and How to Fix It)深度数理推导与工程落地解析
标准化用到了验证/测试集的统计量,把未来信息带进训练;应只在训练集 fit、在验证集 transform。