Tag: efficient-attention-flashattention
-
【AI 核心深度 M4-053】解释 IO 复杂度分析与 roofline 模型(IO Complexity Analysis and the GPU Roofline Performance Model)深度数理推导与工程落地解析
用’访问字节数’衡量算法成本;roofline 用算术强度(FLOPs/字节)判断算力受限还是带宽受限。
-
【AI 核心深度 M4-054】解释 FlashAttention-2/3 的改进(Architectural Innovations in FlashAttention-2 and FlashAttention-3)深度数理推导与工程落地解析
FA2 优化并行度与 warp 调度、减少非 matmul FLOPs;FA3 面向 Hopper 用 TMA 与 warp specialization。
-
【AI 核心深度 M4-055】解释 decode 阶段的注意力瓶颈与 Flash-Decoding(Decoding Phase Attention Bottlenecks and the Flash-Decoding Solution)深度数理推导与工程落地解析
decode 每步只算 1 个 query,但需读取全部 KV cache;并行度不足导致 GPU 空闲,Flash-Decoding 用’切分 KV + 两阶段归约’提升并行。
-
【AI 核心深度 M4-056】解释算子融合与 torch.compile 对注意力的收益(Operator Fusion and torch.compile Speedups in Modern Attention Architectures)深度数理推导与工程落地解析
把多个小算子合并为一个 kernel,减少中间张量的 HBM 往返与 kernel 启动开销;compile 可自动融合并生成高效代码。
-
【AI 核心深度 M4-049】解释 FlashAttention 的 backward 如何避免重算整块(FlashAttention Backward Pass: Recomputing Softmax in SRAM Without Saving Intermediate Matrices)深度数理推导与工程落地解析
保存每行的 (m, ℓ) 与输出 O,反向时用它们重算 S、P(不存 L×L 矩阵),显存 O(L)。
-
【AI 核心深度 M4-050】解释 PagedAttention 如何解决 KV Cache 碎片(PagedAttention: Eliminating KV-Cache Memory Fragmentation via Virtual Memory Paging)深度数理推导与工程落地解析
把 KV cache 分成固定大小的块(page),用块表间接映射,实现非连续存储、按需分配与共享,消除碎片。
-
【AI 核心深度 M4-051】解释 Ring Attention 与序列并行(Ring Attention and Sequence Parallelism for Near-Infinite Context Windows)深度数理推导与工程落地解析
把序列维切到多设备,各设备算局部注意力并用环形传递 K/V 块,实现超长序列的分布式注意力。
-
【AI 核心深度 M4-052】比较注意力优化的三条路线:IO、稀疏、近似(Comparing Attention Optimization Paradigms: IO-Aware, Sparse, and Low-Rank/Approximation)深度数理推导与工程落地解析
IO 优化(Flash)不改数学、只减访存;稀疏只算部分位置;近似用低秩/核/采样降复杂度。三者可叠加。
-
【AI 核心深度 M4-047】解释 FlashAttention 的核心思想(IO 感知与分块)(FlashAttention Core Philosophy: IO-Awareness, SRAM Tiling, and Memory Hierarchy)深度数理推导与工程落地解析
注意力是 memory-bound:不物化 L×L 矩阵,用分块 + 在线 softmax 在 SRAM 内完成计算,减少 HBM 读写。
-
【AI 核心深度 M4-048】解释在线 softmax(online softmax)如何支持分块计算(Online Softmax: Enabling Block-by-Block Incremental Attention Tiling)深度数理推导与工程落地解析
逐块处理时维护 running max 与 running sum,用 e^{m_old−m_new} 重缩放已累积结果,实现与全量 softmax 等价。