AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-117】解释 test-time compute scaling 的两种主要形式。(Dual Modalities of Test-Time Compute Scaling: Sequential Reasoning and Parallel Sampling)深度数理推导与工程落地解析
顺序型(更长 CoT、迭代修正)与并行型(多次采样 + 投票/验证);两者互补,可与模型规模互相替代。
【AI 核心深度 M5-118】解释 best-of-N 与验证器的关系。(Dynamics of Best-of-N Sampling and Verifier Efficacy in Inference Scaling)深度数理推导与工程落地解析
best-of-N 采样 N 个回答后用验证器选最优;效果取决于验证器的质量与 N 的大小。
【AI 核心深度 M5-119】解释过程奖励模型(PRM)与结果奖励模型(ORM)。(Process Reward Models (PRM) vs Outcome Reward Models (ORM) in Test-Time Reasoning)深度数理推导与工程落地解析
ORM 只评最终结果(易标、信号粗);PRM 评每步(信用分配细、可引导搜索,但标注贵)。
【AI 核心深度 M5-120】解释 MCTS / 束搜索在推理中的应用与代价。(Monte Carlo Tree Search (MCTS) and Beam Search in Inference: Applications and Computational Costs)深度数理推导与工程落地解析
把推理组织为树,用搜索算法 + 价值估计探索;能提升质量但成本高(节点数 × 评估次数)。
【AI 核心深度 M5-094】解释 Agent 的失败模式与恢复。(Agent Failure Modes and Robust Recovery Mechanisms)深度数理推导与工程落地解析
常见失败:循环、选错工具、忽略观察、过早终止、目标漂移;用重试、反思、验证、检查点与人工介入恢复。
【AI 核心深度 M5-095】解释 Agent 的强化学习训练(agentic RL)。(Agentic Reinforcement Learning: Multi-Step Decision-Making and Tool Optimization)深度数理推导与工程落地解析
用 RL 训练 Agent 的多步决策(工具选择/调用),奖励为任务成功;难点是稀疏奖励、长轨迹与信用分配。
【AI 核心深度 M5-096】解释计算机使用 Agent(computer use)的挑战。(Challenges in GUI-Based Computer-Use Agents)深度数理推导与工程落地解析
让 Agent 直接操作 GUI(点击/输入/截图);挑战是视觉定位、动作空间大、错误不可逆、评估困难。
【AI 核心深度 M5-097】比较 LLM 评估的几类方法:指标、LLM-judge、人工。(Comparison of LLM Evaluation Paradigms: Heuristic Metrics, LLM-as-a-Judge, and Human Evaluation)深度数理推导与工程落地解析
自动指标便宜但粗糙;LLM-judge 可扩展但需防偏;人工最可靠但贵慢;三者应组合并交叉验证。
【AI 核心深度 M5-098】解释困惑度(PPL)的适用与局限。(Perplexity (PPL) in LLM Evaluation: Applications, BPB Normalization, and Inherent Limitations)深度数理推导与工程落地解析
PPL 衡量’预测下一个 token 的平均不确定性’;适合语言建模对比,但不衡量回答质量,且跨 tokenizer 不可比。
【AI 核心深度 M5-099】解释 LLM-as-a-Judge 的设计要点与偏置缓解。(LLM-as-a-Judge System Design and Bias Mitigation Techniques)深度数理推导与工程落地解析
用强 LLM 打分/比较;需明确评分标准、随机化顺序、控制长度、用不同家族模型,并与人工校准。
【AI 核心深度 M5-100】解释静态 benchmark 的失效与动态评估的必要性。(Degradation of Static Benchmarks and the Necessity of Dynamic Evaluation)深度数理推导与工程落地解析
静态基准会被污染与’刷榜’(过拟合);需动态/私有/程序生成的评估,以及真实场景的在线评估。
【AI 核心深度 M5-101】解释长文本与多轮对话的评估难点。(Challenges in Evaluating Long-Context Understanding and Multi-Turn Dialogues)深度数理推导与工程落地解析
长文本需评’忠实/完整/连贯’且易受位置影响;多轮需评’上下文一致性/指代/目标追踪’,且轮次越多越难。
【AI 核心深度 M5-102】解释安全评估与红队(red teaming)。(Safety Evaluation and Adversarial Red Teaming for Frontier LLMs)深度数理推导与工程落地解析
主动构造对抗性输入(越狱/诱导)找漏洞;需覆盖攻击类型、评估拒答率与危害度,并持续迭代。
【AI 核心深度 M5-103】解释评估的统计显著性与样本量。(Statistical Significance, Confidence Intervals, and Sample Sizing in LLM Evaluation)深度数理推导与工程落地解析
小样本的分数差异可能是噪声;需报告置信区间、做显著性检验、多种子/多 prompt 变体,避免’看单点结论’。
【AI 核心深度 M5-104】解释幻觉的成因与分类。(Taxonomy, Root Causes, and Failure Modes of LLM Hallucinations)深度数理推导与工程落地解析
成因:训练目标(似然而非真值)、知识缺失、上下文误导、解码随机性;分’事实性’与’忠实性’两类。