Tag: hallucination-ai-safety
-
【AI 核心深度 M5-108】解释护栏(guardrails)的分层设计。(Multi-Layer Defense-in-Depth Guardrail Architectures for LLMs)深度数理推导与工程落地解析
输入过滤 → 模型对齐 → 输出过滤 → 运行时监控,多层互补;单层都可能被绕过,故需纵深防御。
-
【AI 核心深度 M5-109】解释对齐税(alignment tax)与安全-能力权衡。(The Alignment Tax and the Pareto Frontier of Safety vs Capability)深度数理推导与工程落地解析
对齐(安全/RLHF)可能损害能力与多样性;需通过混合数据、KL 约束、多目标优化减轻’税’。
-
【AI 核心深度 M5-110】解释幻觉检测的方法(检索一致性 / 自一致性 / 不确定性)。(Hallucination Detection Methodologies: Retrieval Consistency, Self-Consistency, and Uncertainty)深度数理推导与工程落地解析
三类:外部证据核查(检索/工具验证)、内部一致性(多次采样/多模型)、不确定性(语义熵/P(True))。
-
【AI 核心深度 M5-104】解释幻觉的成因与分类。(Taxonomy, Root Causes, and Failure Modes of LLM Hallucinations)深度数理推导与工程落地解析
成因:训练目标(似然而非真值)、知识缺失、上下文误导、解码随机性;分’事实性’与’忠实性’两类。
-
【AI 核心深度 M5-105】列举缓解幻觉的主要手段。(Comprehensive Mitigation Strategies for LLM Hallucinations)深度数理推导与工程落地解析
检索增强(RAG)、工具调用、约束(要求引用/允许不知道)、解码策略、训练(RLHF/偏好数据)、以及后验校验。
-
【AI 核心深度 M5-106】解释不确定性量化与校准在幻觉检测中的作用。(Uncertainty Quantification and Probability Calibration for Hallucination Detection)深度数理推导与工程落地解析
让模型输出置信度并使其’校准’(置信度≈正确率);用语义熵、自一致性、logit 熵检测高幻觉风险的回答。
-
【AI 核心深度 M5-107】解释越狱(jailbreak)与提示注入的攻击面。(Attack Vectors of Jailbreaking and Indirect Prompt Injection)深度数理推导与工程落地解析
越狱:诱导模型绕过安全限制(角色扮演/编码/多轮);注入:把恶意指令藏在数据里(网页/文档/工具返回)。