Tag: inference-time-compute-scaling
-
【AI 核心深度 M5-123】解释并行采样 vs 顺序修正(并行 vs 串行 test-time compute)。(Parallel Sampling vs. Sequential Revision in Test-Time Compute)深度数理推导与工程落地解析
并行:独立采样多条 + 投票/验证(抗单链错误);顺序:单链迭代修正(成本低但受自我纠错能力限制)。
-
【AI 核心深度 M5-121】解释推理算力与模型规模的等价性研究结论。(Equivalence Laws of Inference-Time Compute and Pre-training Model Parameter Scaling)深度数理推导与工程落地解析
在某些任务上’小模型 + 更多推理算力’可匹配’大模型’;但依赖任务类型(可分解/可验证),且不能替代知识。
-
【AI 核心深度 M5-122】如何为推理时计算做成本-收益决策?(Cost-Benefit Decision Framework for Inference-Time Compute Allocation)深度数理推导与工程落地解析
比较’增加推理算力’与’换更大模型’的边际收益;按难度分层、按任务类型选形式,并用 goodput 评估。
-
【AI 核心深度 M5-117】解释 test-time compute scaling 的两种主要形式。(Dual Modalities of Test-Time Compute Scaling: Sequential Reasoning and Parallel Sampling)深度数理推导与工程落地解析
顺序型(更长 CoT、迭代修正)与并行型(多次采样 + 投票/验证);两者互补,可与模型规模互相替代。
-
【AI 核心深度 M5-118】解释 best-of-N 与验证器的关系。(Dynamics of Best-of-N Sampling and Verifier Efficacy in Inference Scaling)深度数理推导与工程落地解析
best-of-N 采样 N 个回答后用验证器选最优;效果取决于验证器的质量与 N 的大小。
-
【AI 核心深度 M5-119】解释过程奖励模型(PRM)与结果奖励模型(ORM)。(Process Reward Models (PRM) vs Outcome Reward Models (ORM) in Test-Time Reasoning)深度数理推导与工程落地解析
ORM 只评最终结果(易标、信号粗);PRM 评每步(信用分配细、可引导搜索,但标注贵)。
-
【AI 核心深度 M5-120】解释 MCTS / 束搜索在推理中的应用与代价。(Monte Carlo Tree Search (MCTS) and Beam Search in Inference: Applications and Computational Costs)深度数理推导与工程落地解析
把推理组织为树,用搜索算法 + 价值估计探索;能提升质量但成本高(节点数 × 评估次数)。