Tag: evaluation-metrics-hyperparameter-tuning
-
【AI 核心深度 M2-118】解释多指标权衡与综合指标(OEC)的设计(Multi-Metric Trade-offs and Designing an Overall Evaluation Criterion (OEC))深度数理推导与工程落地解析
单一综合指标(OEC)便于决策但会掩盖局部;需配合护栏指标与分层分析。
-
【AI 核心深度 M2-119】解释超参调优的自动化工具与实践流程(Automated Hyperparameter Optimization Tools and Industrial Best-Practice Workflows)深度数理推导与工程落地解析
Optuna/Ray Tune 提供 TPE、Hyperband、ASHA 等算法;流程是分阶段(粗筛→精调)并按重要度排序。
-
【AI 核心深度 M2-086】列举分类、回归、排序的常用评估指标(Common Evaluation Metrics for Classification, Regression, and Ranking)深度数理推导与工程落地解析
分类:Accuracy/P/R/F1/AUC/PR-AUC/LogLoss;回归:MSE/MAE/RMSE/R²/分位数损失;排序:NDCG/MRR/MAP/Recall@K。
-
【AI 核心深度 M2-087】比较网格搜索、随机搜索与贝叶斯优化(Comparing Grid Search, Random Search, and Bayesian Optimization)深度数理推导与工程落地解析
网格穷举但指数爆炸;随机搜索在高维更高效;贝叶斯优化用代理模型指导采样。
-
【AI 核心深度 M2-088】什么是超参的重要度排序?如何高效调参(Hyperparameter Importance Hierarchy and Efficient Tuning Strategies)深度数理推导与工程落地解析
用 fANOVA/消融估计各超参对性能的贡献,优先调重要超参(学习率、正则、深度)。
-
【AI 核心深度 M2-089】如何处理调参中的随机性(种子方差)?(Handling Randomness and Seed Variance in Hyperparameter Tuning)深度数理推导与工程落地解析
多次随机种子重复评估,报告均值与标准差;用配对检验比较模型。
-
【AI 核心深度 M2-090】线上评估与离线评估为什么会不一致?如何缩小差距(Why Offline and Online Evaluations Diverge: Causes and Mitigation Strategies)深度数理推导与工程落地解析
离线数据分布、指标代理、反馈回路、延迟效应都与线上不同;需回放评估、反事实评估与在线小流量验证。