AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-133】解释 Prefix/Prompt Tuning 与 LoRA 的差异。(Mechanisms and Architectural Differences: Prefix/Prompt Tuning vs. LoRA)深度数理推导与工程落地解析
Prompt/Prefix Tuning 在输入/每层加可学习前缀(改激活);LoRA 改权重(加低秩增量);后者更通用且可合并。
【AI 核心深度 M5-134】解释 PEFT 方法的选择依据。(Systematic Decision Framework for Parameter-Efficient Fine-Tuning (PEFT) Selection)深度数理推导与工程落地解析
按’显存约束、任务距离、数据量、部署要求(延迟/多任务)’四维选择:LoRA 为默认,QLoRA 省显存,全参用于远域。
【AI 核心深度 M5-135】解释 PEFT 与灾难性遗忘、模型合并的交互。(Interaction of PEFT with Catastrophic Forgetting and Model Merging)深度数理推导与工程落地解析
PEFT 冻结基座天然缓解遗忘;适配器可合并(多任务/任务算术)或分别部署(多 LoRA 服务)。
【AI 核心深度 M5-136】解释 LoRA 的变体(DoRA / LoRA+ / rsLoRA)与秩的选择。(LoRA Architectural Variants (DoRA, LoRA+, rsLoRA) and Rank Selection Strategies)深度数理推导与工程落地解析
DoRA 分解为幅度与方向(更接近全参);LoRA+ 给 B 更大 lr;rsLoRA 修正缩放;秩按任务距离选。
【AI 核心深度 M5-121】解释推理算力与模型规模的等价性研究结论。(Equivalence Laws of Inference-Time Compute and Pre-training Model Parameter Scaling)深度数理推导与工程落地解析
在某些任务上’小模型 + 更多推理算力’可匹配’大模型’;但依赖任务类型(可分解/可验证),且不能替代知识。
【AI 核心深度 M5-122】如何为推理时计算做成本-收益决策?(Cost-Benefit Decision Framework for Inference-Time Compute Allocation)深度数理推导与工程落地解析
比较’增加推理算力’与’换更大模型’的边际收益;按难度分层、按任务类型选形式,并用 goodput 评估。
【AI 核心深度 M5-108】解释护栏(guardrails)的分层设计。(Multi-Layer Defense-in-Depth Guardrail Architectures for LLMs)深度数理推导与工程落地解析
输入过滤 → 模型对齐 → 输出过滤 → 运行时监控,多层互补;单层都可能被绕过,故需纵深防御。
【AI 核心深度 M5-109】解释对齐税(alignment tax)与安全-能力权衡。(The Alignment Tax and the Pareto Frontier of Safety vs Capability)深度数理推导与工程落地解析
对齐(安全/RLHF)可能损害能力与多样性;需通过混合数据、KL 约束、多目标优化减轻’税’。
【AI 核心深度 M5-110】解释幻觉检测的方法(检索一致性 / 自一致性 / 不确定性)。(Hallucination Detection Methodologies: Retrieval Consistency, Self-Consistency, and Uncertainty)深度数理推导与工程落地解析
三类:外部证据核查(检索/工具验证)、内部一致性(多次采样/多模型)、不确定性(语义熵/P(True))。
【AI 核心深度 M5-111】解释约束解码(constrained decoding)的原理。(Principles and Mechanics of Grammar-Constrained Decoding)深度数理推导与工程落地解析
在每个解码步把’不合语法的 token’的 logits 置为 −∞,使采样只落在合法 token 上,从而保证输出符合语法。
【AI 核心深度 M5-112】解释 JSON Schema 约束的实现要点。(Implementation Essentials of JSON Schema Constrained Decoding)深度数理推导与工程落地解析
把 schema 编译为自动机,跟踪解析状态,逐步限制 token;需处理嵌套、枚举、可选字段与数值格式。
【AI 核心深度 M5-113】解释约束解码与后处理修复的差异。(Constrained Decoding vs Post-Hoc Repair: Architectural Trade-offs)深度数理推导与工程落地解析
约束解码在生成时保证合法(一次成功);后处理在生成后修复(可能失败、需重试、有延迟)。
【AI 核心深度 M5-114】解释工具调用中结构化输出的必要性。(Necessity of Structured Outputs in Tool and Function Calling)深度数理推导与工程落地解析
工具参数必须符合 schema(类型/枚举/必需字段);结构化输出(约束解码)保证参数可解析、可执行。
【AI 核心深度 M5-115】解释约束解码对性能与质量的影响。(Impact of Constrained Decoding on Inference Throughput and Generation Quality)深度数理推导与工程落地解析
性能:每步掩码计算有开销(现代实现已优化到 <5%);质量:约束可能迫使模型偏离自然输出,损害内容质量。
【AI 核心深度 M5-116】解释语法约束在代码生成中的应用。(Grammar-Constrained Decoding in Code Generation and Domain-Specific Languages)深度数理推导与工程落地解析
用编程语言的语法(CFG)约束生成,保证语法正确(可编译);对代码补全/结构化生成价值大。