Tag: llm-evaluation-benchmarks
-
【AI 核心深度 M5-097】比较 LLM 评估的几类方法:指标、LLM-judge、人工。(Comparison of LLM Evaluation Paradigms: Heuristic Metrics, LLM-as-a-Judge, and Human Evaluation)深度数理推导与工程落地解析
自动指标便宜但粗糙;LLM-judge 可扩展但需防偏;人工最可靠但贵慢;三者应组合并交叉验证。
-
【AI 核心深度 M5-098】解释困惑度(PPL)的适用与局限。(Perplexity (PPL) in LLM Evaluation: Applications, BPB Normalization, and Inherent Limitations)深度数理推导与工程落地解析
PPL 衡量’预测下一个 token 的平均不确定性’;适合语言建模对比,但不衡量回答质量,且跨 tokenizer 不可比。
-
【AI 核心深度 M5-099】解释 LLM-as-a-Judge 的设计要点与偏置缓解。(LLM-as-a-Judge System Design and Bias Mitigation Techniques)深度数理推导与工程落地解析
用强 LLM 打分/比较;需明确评分标准、随机化顺序、控制长度、用不同家族模型,并与人工校准。
-
【AI 核心深度 M5-100】解释静态 benchmark 的失效与动态评估的必要性。(Degradation of Static Benchmarks and the Necessity of Dynamic Evaluation)深度数理推导与工程落地解析
静态基准会被污染与’刷榜’(过拟合);需动态/私有/程序生成的评估,以及真实场景的在线评估。
-
【AI 核心深度 M5-101】解释长文本与多轮对话的评估难点。(Challenges in Evaluating Long-Context Understanding and Multi-Turn Dialogues)深度数理推导与工程落地解析
长文本需评’忠实/完整/连贯’且易受位置影响;多轮需评’上下文一致性/指代/目标追踪’,且轮次越多越难。
-
【AI 核心深度 M5-102】解释安全评估与红队(red teaming)。(Safety Evaluation and Adversarial Red Teaming for Frontier LLMs)深度数理推导与工程落地解析
主动构造对抗性输入(越狱/诱导)找漏洞;需覆盖攻击类型、评估拒答率与危害度,并持续迭代。
-
【AI 核心深度 M5-103】解释评估的统计显著性与样本量。(Statistical Significance, Confidence Intervals, and Sample Sizing in LLM Evaluation)深度数理推导与工程落地解析
小样本的分数差异可能是噪声;需报告置信区间、做显著性检验、多种子/多 prompt 变体,避免’看单点结论’。