所属模块:
M2 · 经典机器学习 (Classical Machine Learning)| 专题分类:评估指标与超参调优 (Evaluation Metrics & Hyperparameter Tuning)| 难度等级:Easy
一、核心一句话结论 (One-Sentence Summary)
分类:Accuracy/P/R/F1/AUC/PR-AUC/LogLoss;回归:MSE/MAE/RMSE/R²/分位数损失;排序:NDCG/MRR/MAP/Recall@K。
Classification uses Accuracy, F1, PR-AUC, and ROC-AUC; regression uses RMSE, MAE, and MAPE; ranking uses NDCG, MRR, and MAP.
二、核心考点要义 (Key Insights)
- 📌 指标要与业务目标一致
- 📌 不平衡看 PR-AUC;排序看 NDCG
English Insights:
– Classification: Accuracy, Precision, Recall, F1, PR-AUC, ROC-AUC, Brier score
– Regression: RMSE (penalizes large errors), MAE (robust to outliers), MAPE (scale-invariant relative error)
– Ranking: NDCG (graded relevance with logarithmic discount), MRR (position of first hit), MAP (mean precision at relevant ranks)
三、核心数学原理与机理推导 (Mathematical Principles & Derivation)
$$F_1=frac{2PR}{P+R},qquad mathrm{RMSE}=sqrt{frac1nsum(y-hat y)^2}$$
三类指标的要点:分类——① Accuracy:仅在类别平衡时有意义;② Precision/Recall:分别关注’预测为正的准确性’与’真实正类的覆盖率’,需按业务取舍;③ F1:两者的调和平均(惩罚极端值,比算术平均更严格);④ AUC-ROC:阈值无关的排序质量,但在不平衡下过于乐观;⑤ PR-AUC:不平衡下更敏感;⑥ LogLoss(交叉熵):评估概率质量(proper scoring rule),对过度自信惩罚强。回归——① MSE/RMSE:对大误差敏感(平方),与高斯噪声假设对应;② MAE:对异常值鲁棒(线性),对应 Laplace 噪声;③ R²:1−SSE/SST,表示解释的方差比例,可为负(模型比’预测均值’还差);④ 分位数损失:预测分位数(如 P90 延迟)时使用;⑤ MAPE:相对误差,但对接近 0 的真值不稳定。排序——① Recall@K:top-K 中的相关项占比(召回视角);② MRR:第一个相关项排名的倒数均值(关注首位);③ NDCG@K:考虑相关性等级与位置折扣(最全面);④ MAP:平均精度(考虑所有相关项的位置)。
📖 查看英文严格数学推导 (English Mathematical Derivation)
Mathematical Formulations:
① Ranking — NDCG@K: $text{DCG}@K = sum_{i=1}^K frac{2^{r_i} – 1}{log_2(i + 1)}$, $text{NDCG}@K = frac{text{DCG}@K}{text{IDCG}@K}$, where $text{IDCG}@K$ is the ideal DCG obtained by sorting items by ground truth relevance $r_i$.
② Ranking — MRR (Mean Reciprocal Rank): $text{MRR} = frac{1}{|Q|} sum_{q=1}^{|Q|} frac{1}{text{rank}_q}$, measuring the reciprocal rank of the first relevant item.
③ Regression — Metrics: $text{RMSE} = sqrt{frac{1}{N}sum (y_i – hat{y}_i)^2}$ (optimizes conditional mean); $text{MAE} = frac{1}{N}sum |y_i – hat{y}_i|$ (optimizes conditional median); Huber loss smoothly transitions between quadratic and linear regimes.
④ Classification — Matthews Correlation Coefficient (MCC): $text{MCC} = frac{text{TP} cdot text{TN} – text{FP} cdot text{FN}}{sqrt{(text{TP}+text{FP})(text{TP}+text{FN})(text{TN}+text{FP})(text{TN}+text{FN})}}$, symmetric and robust to extreme imbalance.
四、工业级落地权衡与工程考量 (Industrial Trade-offs)
指标选择的实践要点:① 与业务目标对齐——这是第一原则:若业务关心’不漏掉任何欺诈’,主指标应是 Recall(或固定 Precision 下的 Recall);若关心’推荐的点击率’,用 CTR/AUC;若关心’用户找到东西的速度’,用 MRR。② 不要用 accuracy 处理不平衡——多数类占比 99% 时全预测多数类就有 99% 准确率;改用 PR-AUC、F1、balanced accuracy 或 MCC。③ MSE vs MAE 的选择——MSE 对大误差敏感(适合’大误差代价高’的场景,如金融风险);MAE 对异常值鲁棒(适合数据含噪的场景);Huber 是折中。④ R² 的解读——R²<0 说明模型比’直接用均值预测’还差(严重欠拟合或数据划分问题);R² 随特征增加而虚高(需用调整 R²)。⑤ 排序指标的选择——若只关心首位(如自动补全)用 MRR;若关心整体排序质量用 NDCG;若关心覆盖用 Recall@K。⑥ 多指标报告——单一指标易被优化(Goodhart 定律),应同时报告多个指标 + 业务指标 + 护栏指标。
⚙️ 查看英文落地权衡分析 (English Systems & Trade-offs)
Metric alignment with business goals: In e-commerce search, NDCG@10 reflects top-of-page user satisfaction. In supply chain inventory forecasting, asymmetric pinball loss (quantile loss) is preferred over RMSE because stockouts are costlier than excess holding costs.
五、常见面试避坑陷阱 (Common Pitfalls & Traps)
- ⚠️ 在不平衡数据上用 accuracy 作为主指标
- ⚠️ 只看离线指标而不与业务目标对齐
English Pitfalls:
– Using MAPE when actual values can be zero or near-zero, producing division-by-zero explosions
– Evaluating search ranking using binary accuracy or unweighted recall instead of position-discounted NDCG
六、高频深度面试追问与预测 (Follow-Up Questions)
- MAE 与 MSE 的取舍?
- Why does minimizing MSE regression loss predict the conditional mean $mathbb{E}[Y|X]$ while MAE predicts the conditional median?
- 为什么 R² 可能为负?
- What are the structural differences between MAP (Mean Average Precision) and NDCG@K in recommendation systems?
七、知识图谱对齐 (Knowledge Graph Anchor)
- 🔗 关联底层卡片:
分类评估指标:ROC-AUC、PR-AUC、F1-Score 与贝叶斯调优(Evaluation Metrics: ROC-AUC, PR-AUC & Bayesian Optimization) - 🗺️ 知识图谱模块:
经典机器学习思维导图
🔬 算法科学家与机器学习深度考察全量题库 (Science Depth)
本题收录于 TalentMe 算法科学家深度考察真题库 (Science Depth)。全库共 856 道硬核考点,深度覆盖数学统计、经典ML、深度学习、Transformer、大语言模型、多模态、推荐系统与 MLOps。支持 Jev 面经智能匹配、一键离线单文件 HTML 手册导出并直连 Obsidian 本地记忆。