AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M2-069】解释多重共线性下的特征选择策略(Feature Selection Strategies Under Severe Multicollinearity)深度数理推导与工程落地解析
共线特征可任选其一或用正则(L2/EN)保留组信息;不宜按 p 值逐个删。
【AI 核心深度 M2-070】如何评估特征选择的效果?需要注意什么(How to Evaluate Feature Selection Effectiveness? Key Considerations and Validation)深度数理推导与工程落地解析
用嵌套 CV 评估,避免在同一份数据上选择又评估;关注性能-特征数权衡与稳定性。
【AI 核心深度 M2-071】处理类别不平衡的主要方法有哪些?(Major Approaches for Handling Class Imbalance)深度数理推导与工程落地解析
重采样(过/欠采样)、代价敏感、阈值调整、集成、异常检测视角。
【AI 核心深度 M2-072】SMOTE 的原理是什么?有什么风险(SMOTE Algorithm: Core Mechanism, Theoretical Risks, and Limitations)深度数理推导与工程落地解析
在少数类近邻之间线性插值生成合成样本;风险是噪声放大、类别重叠区生成错误样本。
【AI 核心深度 M2-073】为什么不平衡数据下应优先看 PR-AUC 而不是 ROC-AUC?(Why Prioritize PR-AUC Over ROC-AUC in Highly Imbalanced Regimes?)深度数理推导与工程落地解析
ROC 的 FPR 分母是大量负样本,被稀释后曲线仍好看;PR 曲线对少数类更敏感。
【AI 核心深度 M2-074】如何选择分类阈值?不同业务目标下的策略(Classification Threshold Selection Strategies Across Diverse Business Objectives)深度数理推导与工程落地解析
按代价矩阵最小化期望损失,或按业务约束(召回下限)定阈值;用验证集选并考虑校准。
【AI 核心深度 M2-075】代价敏感学习如何实现?与重采样的关系(Cost-Sensitive Learning: Implementation and Relationship with Re-sampling)深度数理推导与工程落地解析
在损失中给不同类别不同权重;等价于按权重重采样(近似),但更稳定且不改变数据分布。
【AI 核心深度 M2-076】缺失值的三种机制是什么?分别该如何处理(Three Missing Data Mechanisms (MCAR, MAR, MNAR) and Treatment Strategies)深度数理推导与工程落地解析
MCAR(完全随机)、MAR(依赖可观测变量)、MNAR(依赖缺失值本身)。
【AI 核心深度 M2-077】比较均值/中位数插补、KNN 插补与多重插补(Comparing Mean/Median, KNN, and Multiple Imputation (MICE))深度数理推导与工程落地解析
简单插补快但低估方差;KNN 利用相似样本;多重插补(MICE)通过多次抽样反映不确定性。
【AI 核心深度 M2-078】什么时候应该加“缺失指示变量”?(When Should You Add a ‘Missing Indicator Variable’?)深度数理推导与工程落地解析
当缺失本身有信息(MNAR 或缺失与目标相关)时,指示变量能显著提升模型。
【AI 核心深度 M2-079】如何系统性排查数据泄漏?给出可操作的清单(How to Systematically Audit Data Leakage? An Actionable Checklist)深度数理推导与工程落地解析
按时间切分、把预处理放进 pipeline、检查特征可得时间、做特征-标签相关性审计、用随机标签测试。
【AI 核心深度 M2-080】为什么“先全量标准化再切分”是数据泄漏?如何修正(Why Global Normalization Before Splitting Causes Data Leakage and How to Fix It)深度数理推导与工程落地解析
标准化用到了验证/测试集的统计量,把未来信息带进训练;应只在训练集 fit、在验证集 transform。
【AI 核心深度 M2-081】定义模型校准,并解释为什么高准确率不等于好校准(Defining Model Calibration: Why High Accuracy Does Not Imply Good Calibration)深度数理推导与工程落地解析
校准指预测概率与真实频率一致;准确率高但概率系统性偏大/偏小仍是不校准。
【AI 核心深度 M2-082】比较 Platt scaling 与 Isotonic regression(Comparing Platt Scaling and Isotonic Regression for Probability Calibration)深度数理推导与工程落地解析
Platt 拟合 sigmoid(参数少、需较少数据);Isotonic 拟合单调阶梯(更灵活但易过拟合)。
【AI 核心深度 M2-083】解释 ECE(期望校准误差)的计算与局限(Expected Calibration Error (ECE): Mathematical Formulation and Practical Limitations)深度数理推导与工程落地解析
按置信度分箱,计算 |平均置信度 − 平均准确率| 的加权和;局限是依赖分箱且对样本量敏感。