Tag: machine-learning
-
【AI 核心深度 M4-056】解释算子融合与 torch.compile 对注意力的收益(Operator Fusion and torch.compile Speedups in Modern Attention Architectures)深度数理推导与工程落地解析
把多个小算子合并为一个 kernel,减少中间张量的 HBM 往返与 kernel 启动开销;compile 可自动融合并生成高效代码。
-
【AI 核心深度 M4-057】解释 KV Cache 的原理,为什么训练时不能用。(KV Cache Principles and Why It Cannot Be Used During Training)深度数理推导与工程落地解析
缓存已算过的 K/V 避免重复计算,把每步复杂度从 O(S²) 降到 O(S);但训练需全序列并行反向,缓存无用且占显存。
-
【AI 核心深度 M4-058】解释 prefill 与 decode 两阶段的差异。(Differences Between Prefill and Decode Phases in LLM Inference)深度数理推导与工程落地解析
prefill 并行处理输入(compute-bound、算力密集);decode 逐 token 生成(memory-bound、读 KV);两者需不同优化。
-
【AI 核心深度 M4-059】解释投机解码(speculative decoding)的无损性。(Losslessness and Theoretical Guarantee of Speculative Decoding)深度数理推导与工程落地解析
用廉价草稿模型提议 k 个 token,目标模型一次并行验证;按接受/拒绝规则采样可证明输出分布与目标模型一致。
-
【AI 核心深度 M4-060】解释连续批处理(continuous batching)与静态批处理的差异。(Continuous Batching vs. Static Batching in LLM Serving)深度数理推导与工程落地解析
静态批需等整批完成才能换新请求(GPU 空转);连续批在每步迭代后动态插入/移除请求,大幅提升吞吐。
-
【AI 核心深度 M4-061】解释前缀缓存(prefix caching)与 RadixAttention。(Prefix Caching and RadixAttention Mechanisms)深度数理推导与工程落地解析
缓存相同前缀的 KV 块,多请求复用;RadixAttention 用基数树(前缀树)组织块,实现自动复用与 LRU 淘汰。
-
【AI 核心深度 M4-062】如何降低 KV Cache 显存?列出主要方法。(Methods to Reduce KV Cache Memory Footprint)深度数理推导与工程落地解析
减少元素数(GQA/MQA/MLA、稀疏/窗口)与减少每元素位数(KV 量化),以及跨请求共享(前缀缓存)与分层策略。
-
【AI 核心深度 M4-049】解释 FlashAttention 的 backward 如何避免重算整块(FlashAttention Backward Pass: Recomputing Softmax in SRAM Without Saving Intermediate Matrices)深度数理推导与工程落地解析
保存每行的 (m, ℓ) 与输出 O,反向时用它们重算 S、P(不存 L×L 矩阵),显存 O(L)。
-
【AI 核心深度 M4-050】解释 PagedAttention 如何解决 KV Cache 碎片(PagedAttention: Eliminating KV-Cache Memory Fragmentation via Virtual Memory Paging)深度数理推导与工程落地解析
把 KV cache 分成固定大小的块(page),用块表间接映射,实现非连续存储、按需分配与共享,消除碎片。
-
【AI 核心深度 M4-051】解释 Ring Attention 与序列并行(Ring Attention and Sequence Parallelism for Near-Infinite Context Windows)深度数理推导与工程落地解析
把序列维切到多设备,各设备算局部注意力并用环形传递 K/V 块,实现超长序列的分布式注意力。