Tag: module-m5
-
【AI 核心深度 M5-112】解释 JSON Schema 约束的实现要点。(Implementation Essentials of JSON Schema Constrained Decoding)深度数理推导与工程落地解析
把 schema 编译为自动机,跟踪解析状态,逐步限制 token;需处理嵌套、枚举、可选字段与数值格式。
-
【AI 核心深度 M5-113】解释约束解码与后处理修复的差异。(Constrained Decoding vs Post-Hoc Repair: Architectural Trade-offs)深度数理推导与工程落地解析
约束解码在生成时保证合法(一次成功);后处理在生成后修复(可能失败、需重试、有延迟)。
-
【AI 核心深度 M5-114】解释工具调用中结构化输出的必要性。(Necessity of Structured Outputs in Tool and Function Calling)深度数理推导与工程落地解析
工具参数必须符合 schema(类型/枚举/必需字段);结构化输出(约束解码)保证参数可解析、可执行。
-
【AI 核心深度 M5-115】解释约束解码对性能与质量的影响。(Impact of Constrained Decoding on Inference Throughput and Generation Quality)深度数理推导与工程落地解析
性能:每步掩码计算有开销(现代实现已优化到 <5%);质量:约束可能迫使模型偏离自然输出,损害内容质量。
-
【AI 核心深度 M5-116】解释语法约束在代码生成中的应用。(Grammar-Constrained Decoding in Code Generation and Domain-Specific Languages)深度数理推导与工程落地解析
用编程语言的语法(CFG)约束生成,保证语法正确(可编译);对代码补全/结构化生成价值大。
-
【AI 核心深度 M5-117】解释 test-time compute scaling 的两种主要形式。(Dual Modalities of Test-Time Compute Scaling: Sequential Reasoning and Parallel Sampling)深度数理推导与工程落地解析
顺序型(更长 CoT、迭代修正)与并行型(多次采样 + 投票/验证);两者互补,可与模型规模互相替代。
-
【AI 核心深度 M5-118】解释 best-of-N 与验证器的关系。(Dynamics of Best-of-N Sampling and Verifier Efficacy in Inference Scaling)深度数理推导与工程落地解析
best-of-N 采样 N 个回答后用验证器选最优;效果取决于验证器的质量与 N 的大小。
-
【AI 核心深度 M5-119】解释过程奖励模型(PRM)与结果奖励模型(ORM)。(Process Reward Models (PRM) vs Outcome Reward Models (ORM) in Test-Time Reasoning)深度数理推导与工程落地解析
ORM 只评最终结果(易标、信号粗);PRM 评每步(信用分配细、可引导搜索,但标注贵)。
-
【AI 核心深度 M5-120】解释 MCTS / 束搜索在推理中的应用与代价。(Monte Carlo Tree Search (MCTS) and Beam Search in Inference: Applications and Computational Costs)深度数理推导与工程落地解析
把推理组织为树,用搜索算法 + 价值估计探索;能提升质量但成本高(节点数 × 评估次数)。
-
【AI 核心深度 M5-094】解释 Agent 的失败模式与恢复。(Agent Failure Modes and Robust Recovery Mechanisms)深度数理推导与工程落地解析
常见失败:循环、选错工具、忽略观察、过早终止、目标漂移;用重试、反思、验证、检查点与人工介入恢复。