Tag: module-m4
-
【AI 核心深度 M4-053】解释 IO 复杂度分析与 roofline 模型(IO Complexity Analysis and the GPU Roofline Performance Model)深度数理推导与工程落地解析
用’访问字节数’衡量算法成本;roofline 用算术强度(FLOPs/字节)判断算力受限还是带宽受限。
-
【AI 核心深度 M4-054】解释 FlashAttention-2/3 的改进(Architectural Innovations in FlashAttention-2 and FlashAttention-3)深度数理推导与工程落地解析
FA2 优化并行度与 warp 调度、减少非 matmul FLOPs;FA3 面向 Hopper 用 TMA 与 warp specialization。
-
【AI 核心深度 M4-055】解释 decode 阶段的注意力瓶颈与 Flash-Decoding(Decoding Phase Attention Bottlenecks and the Flash-Decoding Solution)深度数理推导与工程落地解析
decode 每步只算 1 个 query,但需读取全部 KV cache;并行度不足导致 GPU 空闲,Flash-Decoding 用’切分 KV + 两阶段归约’提升并行。
-
【AI 核心深度 M4-056】解释算子融合与 torch.compile 对注意力的收益(Operator Fusion and torch.compile Speedups in Modern Attention Architectures)深度数理推导与工程落地解析
把多个小算子合并为一个 kernel,减少中间张量的 HBM 往返与 kernel 启动开销;compile 可自动融合并生成高效代码。
-
【AI 核心深度 M4-057】解释 KV Cache 的原理,为什么训练时不能用。(KV Cache Principles and Why It Cannot Be Used During Training)深度数理推导与工程落地解析
缓存已算过的 K/V 避免重复计算,把每步复杂度从 O(S²) 降到 O(S);但训练需全序列并行反向,缓存无用且占显存。
-
【AI 核心深度 M4-058】解释 prefill 与 decode 两阶段的差异。(Differences Between Prefill and Decode Phases in LLM Inference)深度数理推导与工程落地解析
prefill 并行处理输入(compute-bound、算力密集);decode 逐 token 生成(memory-bound、读 KV);两者需不同优化。
-
【AI 核心深度 M4-059】解释投机解码(speculative decoding)的无损性。(Losslessness and Theoretical Guarantee of Speculative Decoding)深度数理推导与工程落地解析
用廉价草稿模型提议 k 个 token,目标模型一次并行验证;按接受/拒绝规则采样可证明输出分布与目标模型一致。
-
【AI 核心深度 M4-060】解释连续批处理(continuous batching)与静态批处理的差异。(Continuous Batching vs. Static Batching in LLM Serving)深度数理推导与工程落地解析
静态批需等整批完成才能换新请求(GPU 空转);连续批在每步迭代后动态插入/移除请求,大幅提升吞吐。
-
【AI 核心深度 M4-061】解释前缀缓存(prefix caching)与 RadixAttention。(Prefix Caching and RadixAttention Mechanisms)深度数理推导与工程落地解析
缓存相同前缀的 KV 块,多请求复用;RadixAttention 用基数树(前缀树)组织块,实现自动复用与 LRU 淘汰。
-
【AI 核心深度 M4-062】如何降低 KV Cache 显存?列出主要方法。(Methods to Reduce KV Cache Memory Footprint)深度数理推导与工程落地解析
减少元素数(GQA/MQA/MLA、稀疏/窗口)与减少每元素位数(KV 量化),以及跨请求共享(前缀缓存)与分层策略。