Tag: offline-evaluation-ope
-
【AI 核心深度 M7-089】解释反事实评估的因果图与假设(Explain Causal Directed Acyclic Graphs (DAGs), Do-Calculus, and Backdoor Paths in Counterfactual Evaluation)深度数理推导与工程落地解析
用因果图(DAG)表达’混淆、动作、奖励’的关系;OPE 的目标是估计’干预(do)’的效果,需切断混淆路径。
-
【AI 核心深度 M7-090】解释序列决策的 OPE(多步 IPS / DR)(Explain Off-Policy Evaluation for Sequential Decision-Making: Multi-Step Trajectory IPS and Doubly Robust)深度数理推导与工程落地解析
序列决策中动作影响后续状态(长期效应);多步 IPS 用’轨迹级’权重,方差随长度指数增长。
-
【AI 核心深度 M7-091】解释 OPE 的置信区间与样本量(Explain Confidence Interval Estimation and Effective Sample Size (ESS) in Off-Policy Evaluation)深度数理推导与工程落地解析
OPE 估计有方差,需报告置信区间(bootstrap/解析);有效样本量(ESS)比原始样本量更关键。
-
【AI 核心深度 M7-092】解释 OPE 在推荐/广告中的实践流程(Explain the End-to-End Practical Workflow for Off-Policy Evaluation in Production Recommendation and Ad Systems)深度数理推导与工程落地解析
标准流程:明确目标与假设 → 收集数据(含随机化)→ 训练倾向/模型 → 估计 + CI → 与历史 A/B 验证 → 离线粗筛 → A/B 定胜负。
-
【AI 核心深度 M7-083】解释离线评估为何不能直接用历史数据评估新策略(Explain Why Offline Evaluation Cannot Naively Use Historical Logged Data to Evaluate New Policies)深度数理推导与工程落地解析
历史数据由’旧策略’产生(有偏),故’新策略在历史数据上的表现’不等于’新策略上线后的表现’。
-
【AI 核心深度 M7-084】写出 IPS 估计式并解释其方差问题(Write the Inverse Propensity Scoring (IPS) Estimator and Explain Its High Variance and Mitigation Strategies)深度数理推导与工程落地解析
IPS 用’1/倾向’加权历史奖励,得到无偏估计;但倾向很小时权重爆炸 → 方差极大(需截断/自归一化)。
-
【AI 核心深度 M7-085】解释 Doubly Robust 估计与它的双重稳健性(Explain the Doubly Robust (DR) Estimator and Its Dual Robustness Property in Off-Policy Evaluation)深度数理推导与工程落地解析
DR = 直接方法(模型预测)+ IPS 修正;模型或倾向之一正确即可无偏(双重稳健),且方差通常更低。
-
【AI 核心深度 M7-086】解释 OPE 中的权重截断与自归一化(Explain Importance Weight Clipping and Self-Normalization (SNIPS) in Off-Policy Evaluation)深度数理推导与工程落地解析
权重截断把 w 限制在 [0,M](降方差、引入偏差);自归一化用 Σw 归一(有界、对缩放不敏感)。
-
【AI 核心深度 M7-087】解释离线评估与在线 A/B 的相关性验证(Explain the Methodological Verification of Correlation Between Offline OPE Metrics and Online A/B Results)深度数理推导与工程落地解析
OPE/离线指标需与’在线 A/B 结果’相关才有意义;用历史 A/B 数据验证相关性(相关系数、排序一致性)。
-
【AI 核心深度 M7-088】解释 OPE 的适用条件与失败模式(Explain Core Assumptions, Failure Modes, and Violation Diagnostics in Off-Policy Evaluation)深度数理推导与工程落地解析
OPE 需三大假设(无混淆/正性/SUTVA);常见失败:正性违反(新策略选新物品)、混淆、干扰、非平稳。