AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M4-057】解释 KV Cache 的原理,为什么训练时不能用。(KV Cache Principles and Why It Cannot Be Used During Training)深度数理推导与工程落地解析
缓存已算过的 K/V 避免重复计算,把每步复杂度从 O(S²) 降到 O(S);但训练需全序列并行反向,缓存无用且占显存。
【AI 核心深度 M4-058】解释 prefill 与 decode 两阶段的差异。(Differences Between Prefill and Decode Phases in LLM Inference)深度数理推导与工程落地解析
prefill 并行处理输入(compute-bound、算力密集);decode 逐 token 生成(memory-bound、读 KV);两者需不同优化。
【AI 核心深度 M4-059】解释投机解码(speculative decoding)的无损性。(Losslessness and Theoretical Guarantee of Speculative Decoding)深度数理推导与工程落地解析
用廉价草稿模型提议 k 个 token,目标模型一次并行验证;按接受/拒绝规则采样可证明输出分布与目标模型一致。
【AI 核心深度 M4-060】解释连续批处理(continuous batching)与静态批处理的差异。(Continuous Batching vs. Static Batching in LLM Serving)深度数理推导与工程落地解析
静态批需等整批完成才能换新请求(GPU 空转);连续批在每步迭代后动态插入/移除请求,大幅提升吞吐。
【AI 核心深度 M4-061】解释前缀缓存(prefix caching)与 RadixAttention。(Prefix Caching and RadixAttention Mechanisms)深度数理推导与工程落地解析
缓存相同前缀的 KV 块,多请求复用;RadixAttention 用基数树(前缀树)组织块,实现自动复用与 LRU 淘汰。
【AI 核心深度 M4-062】如何降低 KV Cache 显存?列出主要方法。(Methods to Reduce KV Cache Memory Footprint)深度数理推导与工程落地解析
减少元素数(GQA/MQA/MLA、稀疏/窗口)与减少每元素位数(KV 量化),以及跨请求共享(前缀缓存)与分层策略。
【AI 核心深度 M4-049】解释 FlashAttention 的 backward 如何避免重算整块(FlashAttention Backward Pass: Recomputing Softmax in SRAM Without Saving Intermediate Matrices)深度数理推导与工程落地解析
保存每行的 (m, ℓ) 与输出 O,反向时用它们重算 S、P(不存 L×L 矩阵),显存 O(L)。
【AI 核心深度 M4-050】解释 PagedAttention 如何解决 KV Cache 碎片(PagedAttention: Eliminating KV-Cache Memory Fragmentation via Virtual Memory Paging)深度数理推导与工程落地解析
把 KV cache 分成固定大小的块(page),用块表间接映射,实现非连续存储、按需分配与共享,消除碎片。
【AI 核心深度 M4-051】解释 Ring Attention 与序列并行(Ring Attention and Sequence Parallelism for Near-Infinite Context Windows)深度数理推导与工程落地解析
把序列维切到多设备,各设备算局部注意力并用环形传递 K/V 块,实现超长序列的分布式注意力。
【AI 核心深度 M4-052】比较注意力优化的三条路线:IO、稀疏、近似(Comparing Attention Optimization Paradigms: IO-Aware, Sparse, and Low-Rank/Approximation)深度数理推导与工程落地解析
IO 优化(Flash)不改数学、只减访存;稀疏只算部分位置;近似用低秩/核/采样降复杂度。三者可叠加。
【AI 核心深度 M4-035】解释 MQA 与 GQA,以及它们如何降低 KV Cache(Multi-Query Attention (MQA) and Grouped-Query Attention (GQA): Slashing KV-Cache Memory)深度数理推导与工程落地解析
MQA 让所有头共享一组 K/V;GQA 把头分组、组内共享。KV cache 显存与带宽降为 1/h 或 1/g。
【AI 核心深度 M4-036】解释 MLA(多头潜在注意力)如何压缩 KV Cache(Multi-Head Latent Attention (MLA): DeepSeek’s Low-Rank KV Cache Compression)深度数理推导与工程落地解析
把 K/V 投影到低维潜在向量再缓存,推理时上投影回多头;KV cache 降为约 1/10,且质量可超过 MHA。
【AI 核心深度 M4-037】解释稀疏注意力与滑动窗口注意力(Sparse Attention Mechanisms and Sliding Window Attention (SWA))深度数理推导与工程落地解析
只让每个 token 关注部分位置(局部窗口 / 固定稀疏模式 / 学习式),把 O(L²) 降到 O(L·w) 或 O(L·k)。
【AI 核心深度 M4-038】解释线性注意力与核方法的关系(Linear Attention and Kernel Methods: Associative Matrix Multiplication and O(N) Complexity)深度数理推导与工程落地解析
把 softmax 写成核函数 φ(q)·φ(k),则注意力可重排为’先算 KᵀV 再乘 Q’,复杂度降为 O(Ld²)。
【AI 核心深度 M4-039】解释差分注意力(Differential Attention)的动机(Differential Attention (Diff Transformer): Design Motivation and Noise Cancellation)深度数理推导与工程落地解析
用两组注意力相减,抵消’注意力噪声/汇聚’,使模型能聚焦信号;DIFF Transformer 用此提升长上下文与抗干扰。