Tag: module-m4
-
【AI 核心深度 M4-049】解释 FlashAttention 的 backward 如何避免重算整块(FlashAttention Backward Pass: Recomputing Softmax in SRAM Without Saving Intermediate Matrices)深度数理推导与工程落地解析
保存每行的 (m, ℓ) 与输出 O,反向时用它们重算 S、P(不存 L×L 矩阵),显存 O(L)。
-
【AI 核心深度 M4-050】解释 PagedAttention 如何解决 KV Cache 碎片(PagedAttention: Eliminating KV-Cache Memory Fragmentation via Virtual Memory Paging)深度数理推导与工程落地解析
把 KV cache 分成固定大小的块(page),用块表间接映射,实现非连续存储、按需分配与共享,消除碎片。
-
【AI 核心深度 M4-051】解释 Ring Attention 与序列并行(Ring Attention and Sequence Parallelism for Near-Infinite Context Windows)深度数理推导与工程落地解析
把序列维切到多设备,各设备算局部注意力并用环形传递 K/V 块,实现超长序列的分布式注意力。
-
【AI 核心深度 M4-052】比较注意力优化的三条路线:IO、稀疏、近似(Comparing Attention Optimization Paradigms: IO-Aware, Sparse, and Low-Rank/Approximation)深度数理推导与工程落地解析
IO 优化(Flash)不改数学、只减访存;稀疏只算部分位置;近似用低秩/核/采样降复杂度。三者可叠加。
-
【AI 核心深度 M4-035】解释 MQA 与 GQA,以及它们如何降低 KV Cache(Multi-Query Attention (MQA) and Grouped-Query Attention (GQA): Slashing KV-Cache Memory)深度数理推导与工程落地解析
MQA 让所有头共享一组 K/V;GQA 把头分组、组内共享。KV cache 显存与带宽降为 1/h 或 1/g。
-
【AI 核心深度 M4-036】解释 MLA(多头潜在注意力)如何压缩 KV Cache(Multi-Head Latent Attention (MLA): DeepSeek’s Low-Rank KV Cache Compression)深度数理推导与工程落地解析
把 K/V 投影到低维潜在向量再缓存,推理时上投影回多头;KV cache 降为约 1/10,且质量可超过 MHA。
-
【AI 核心深度 M4-037】解释稀疏注意力与滑动窗口注意力(Sparse Attention Mechanisms and Sliding Window Attention (SWA))深度数理推导与工程落地解析
只让每个 token 关注部分位置(局部窗口 / 固定稀疏模式 / 学习式),把 O(L²) 降到 O(L·w) 或 O(L·k)。
-
【AI 核心深度 M4-038】解释线性注意力与核方法的关系(Linear Attention and Kernel Methods: Associative Matrix Multiplication and O(N) Complexity)深度数理推导与工程落地解析
把 softmax 写成核函数 φ(q)·φ(k),则注意力可重排为’先算 KᵀV 再乘 Q’,复杂度降为 O(Ld²)。
-
【AI 核心深度 M4-039】解释差分注意力(Differential Attention)的动机(Differential Attention (Diff Transformer): Design Motivation and Noise Cancellation)深度数理推导与工程落地解析
用两组注意力相减,抵消’注意力噪声/汇聚’,使模型能聚焦信号;DIFF Transformer 用此提升长上下文与抗干扰。
-
【AI 核心深度 M4-040】解释注意力汇聚(attention sink)现象(The Attention Sink Phenomenon: Origins, Mechanics, and StreamingLLM)深度数理推导与工程落地解析
大量注意力集中到序列开头的少数 token(尤其首 token),即使它们语义无关;因 softmax 需’归一化出口’。