Tag: grpo-reasoning-models
-
【AI 核心深度 M5-059】解释推理模型的评估与成本权衡。(Evaluation and Cost Trade-offs of Reasoning Models)深度数理推导与工程落地解析
评估需覆盖多难度与多领域(且防污染);成本 ∝ 输出长度,需在准确率与 token 成本间权衡(自适应推理)。
-
【AI 核心深度 M5-060】解释 GRPO 的 group size 与采样效率。(Group Size and Sampling Efficiency in GRPO)深度数理推导与工程落地解析
G 越大基线越准但采样成本 ∝G;G 太小则优势估计噪声大;常用 8~64,且需处理’全对/全错’的退化。