Tag: module-m7
-
【AI 核心深度 M7-089】解释反事实评估的因果图与假设(Explain Causal Directed Acyclic Graphs (DAGs), Do-Calculus, and Backdoor Paths in Counterfactual Evaluation)深度数理推导与工程落地解析
用因果图(DAG)表达’混淆、动作、奖励’的关系;OPE 的目标是估计’干预(do)’的效果,需切断混淆路径。
-
【AI 核心深度 M7-090】解释序列决策的 OPE(多步 IPS / DR)(Explain Off-Policy Evaluation for Sequential Decision-Making: Multi-Step Trajectory IPS and Doubly Robust)深度数理推导与工程落地解析
序列决策中动作影响后续状态(长期效应);多步 IPS 用’轨迹级’权重,方差随长度指数增长。
-
【AI 核心深度 M7-091】解释 OPE 的置信区间与样本量(Explain Confidence Interval Estimation and Effective Sample Size (ESS) in Off-Policy Evaluation)深度数理推导与工程落地解析
OPE 估计有方差,需报告置信区间(bootstrap/解析);有效样本量(ESS)比原始样本量更关键。
-
【AI 核心深度 M7-092】解释 OPE 在推荐/广告中的实践流程(Explain the End-to-End Practical Workflow for Off-Policy Evaluation in Production Recommendation and Ad Systems)深度数理推导与工程落地解析
标准流程:明确目标与假设 → 收集数据(含随机化)→ 训练倾向/模型 → 估计 + CI → 与历史 A/B 验证 → 离线粗筛 → A/B 定胜负。
-
【AI 核心深度 M7-093】解释推荐/搜索的核心在线指标(Explain the Taxonomy and Measurement of Core Online Business Metrics in Search and Recommendation)深度数理推导与工程落地解析
参与度(CTR/时长/会话深度)、转化(CVR/GMV)、留存(次日/次周)、生态(多样性/创作者);分层报告。
-
【AI 核心深度 M7-094】解释为什么需要护栏指标(Guardrail Metrics)(Explain the Purpose, Categories, and Veto Mechanisms of Guardrail Metrics in Production Systems)深度数理推导与工程落地解析
护栏指标是’必须不恶化’的指标(一票否决);防止短期优化损害长期(用户体验/生态/安全)。
-
【AI 核心深度 M7-095】解释搜索/推荐中的位置偏置对在线指标的影响(Explain the Impact of Position Bias on Online Experimentation and Metric Confounding)深度数理推导与工程落地解析
位置偏置使’排名提升’自动带来’指标提升’(与相关性无关);故 A/B 中需注意’位置变化’的混淆。
-
【AI 核心深度 M7-096】解释网络效应与干扰(Interference)对实验的影响(Explain Network Interference, Marketplace Cannibalization, and SUTVA Violations in Online Experimentation)深度数理推导与工程落地解析
用户间/物品间相互影响(社交、供需、竞争)破坏 SUTVA;需集群随机化、switchback、或预算分割。
-
【AI 核心深度 M7-097】解释长期效应评估的方法(Explain Methodologies for Measuring Long-Term Algorithmic Effects in Digital Platforms)深度数理推导与工程落地解析
长期效应需长周期实验(holdout 组)、代理指标(需验证)、或切换实验;短期 A/B 无法捕捉。
-
【AI 核心深度 M7-098】解释实验平台的能力要求(Explain the Architectural and Algorithmic Requirements of an Enterprise Experimentation Platform)深度数理推导与工程落地解析
需支持:流量分配(分层/互斥)、指标计算(实时/离线)、方差降低(CUPED)、多重比较校正、以及’实验管理’。