Tag: applied-scientist
-
【AI 核心深度 M5-095】解释 Agent 的强化学习训练(agentic RL)。(Agentic Reinforcement Learning: Multi-Step Decision-Making and Tool Optimization)深度数理推导与工程落地解析
用 RL 训练 Agent 的多步决策(工具选择/调用),奖励为任务成功;难点是稀疏奖励、长轨迹与信用分配。
-
【AI 核心深度 M5-096】解释计算机使用 Agent(computer use)的挑战。(Challenges in GUI-Based Computer-Use Agents)深度数理推导与工程落地解析
让 Agent 直接操作 GUI(点击/输入/截图);挑战是视觉定位、动作空间大、错误不可逆、评估困难。
-
【AI 核心深度 M5-097】比较 LLM 评估的几类方法:指标、LLM-judge、人工。(Comparison of LLM Evaluation Paradigms: Heuristic Metrics, LLM-as-a-Judge, and Human Evaluation)深度数理推导与工程落地解析
自动指标便宜但粗糙;LLM-judge 可扩展但需防偏;人工最可靠但贵慢;三者应组合并交叉验证。
-
【AI 核心深度 M5-098】解释困惑度(PPL)的适用与局限。(Perplexity (PPL) in LLM Evaluation: Applications, BPB Normalization, and Inherent Limitations)深度数理推导与工程落地解析
PPL 衡量’预测下一个 token 的平均不确定性’;适合语言建模对比,但不衡量回答质量,且跨 tokenizer 不可比。
-
【AI 核心深度 M5-099】解释 LLM-as-a-Judge 的设计要点与偏置缓解。(LLM-as-a-Judge System Design and Bias Mitigation Techniques)深度数理推导与工程落地解析
用强 LLM 打分/比较;需明确评分标准、随机化顺序、控制长度、用不同家族模型,并与人工校准。
-
【AI 核心深度 M5-100】解释静态 benchmark 的失效与动态评估的必要性。(Degradation of Static Benchmarks and the Necessity of Dynamic Evaluation)深度数理推导与工程落地解析
静态基准会被污染与’刷榜’(过拟合);需动态/私有/程序生成的评估,以及真实场景的在线评估。
-
【AI 核心深度 M5-101】解释长文本与多轮对话的评估难点。(Challenges in Evaluating Long-Context Understanding and Multi-Turn Dialogues)深度数理推导与工程落地解析
长文本需评’忠实/完整/连贯’且易受位置影响;多轮需评’上下文一致性/指代/目标追踪’,且轮次越多越难。
-
【AI 核心深度 M5-102】解释安全评估与红队(red teaming)。(Safety Evaluation and Adversarial Red Teaming for Frontier LLMs)深度数理推导与工程落地解析
主动构造对抗性输入(越狱/诱导)找漏洞;需覆盖攻击类型、评估拒答率与危害度,并持续迭代。
-
【AI 核心深度 M5-103】解释评估的统计显著性与样本量。(Statistical Significance, Confidence Intervals, and Sample Sizing in LLM Evaluation)深度数理推导与工程落地解析
小样本的分数差异可能是噪声;需报告置信区间、做显著性检验、多种子/多 prompt 变体,避免’看单点结论’。
-
【AI 核心深度 M5-104】解释幻觉的成因与分类。(Taxonomy, Root Causes, and Failure Modes of LLM Hallucinations)深度数理推导与工程落地解析
成因:训练目标(似然而非真值)、知识缺失、上下文误导、解码随机性;分’事实性’与’忠实性’两类。