Tag: kv-cache-inference-optimizations
-
【AI 核心深度 M4-063】解释 chunked prefill 与混合批处理调度。(Chunked Prefill and Piggyback Hybrid Batch Scheduling)深度数理推导与工程落地解析
把长 prompt 的 prefill 切成小块,与 decode 请求混在同一批中,兼顾 TTFT 与吞吐(算力与带宽互补)。
-
【AI 核心深度 M4-064】解释投机解码的变体(Medusa / EAGLE / MTP)。(Speculative Decoding Variants: Medusa, EAGLE, and Multi-Token Prediction)深度数理推导与工程落地解析
Medusa 加多个预测头一次预测多 token;EAGLE 在特征层自回归预测;MTP 在训练时加多 token 预测目标。
-
【AI 核心深度 M4-065】解释推理的吞吐-延迟权衡(TTFT / TPOT / 批大小)。(Throughput vs. Latency Trade-offs in Inference: TTFT, TPOT, and Batch Size)深度数理推导与工程落地解析
增大 batch 提升吞吐但增加单请求延迟(TTFT/TPOT);服务需在 SLO 约束下最大化吞吐。
-
【AI 核心深度 M4-066】解释 PD 分离(prefill-decode disaggregation)。(Prefill-Decode Disaggregation Architecture)深度数理推导与工程落地解析
把 prefill 与 decode 部署在不同实例(各自优化),通过高速网络传 KV cache;消除两阶段互相干扰。
-
【AI 核心深度 M4-057】解释 KV Cache 的原理,为什么训练时不能用。(KV Cache Principles and Why It Cannot Be Used During Training)深度数理推导与工程落地解析
缓存已算过的 K/V 避免重复计算,把每步复杂度从 O(S²) 降到 O(S);但训练需全序列并行反向,缓存无用且占显存。
-
【AI 核心深度 M4-058】解释 prefill 与 decode 两阶段的差异。(Differences Between Prefill and Decode Phases in LLM Inference)深度数理推导与工程落地解析
prefill 并行处理输入(compute-bound、算力密集);decode 逐 token 生成(memory-bound、读 KV);两者需不同优化。
-
【AI 核心深度 M4-059】解释投机解码(speculative decoding)的无损性。(Losslessness and Theoretical Guarantee of Speculative Decoding)深度数理推导与工程落地解析
用廉价草稿模型提议 k 个 token,目标模型一次并行验证;按接受/拒绝规则采样可证明输出分布与目标模型一致。
-
【AI 核心深度 M4-060】解释连续批处理(continuous batching)与静态批处理的差异。(Continuous Batching vs. Static Batching in LLM Serving)深度数理推导与工程落地解析
静态批需等整批完成才能换新请求(GPU 空转);连续批在每步迭代后动态插入/移除请求,大幅提升吞吐。
-
【AI 核心深度 M4-061】解释前缀缓存(prefix caching)与 RadixAttention。(Prefix Caching and RadixAttention Mechanisms)深度数理推导与工程落地解析
缓存相同前缀的 KV 块,多请求复用;RadixAttention 用基数树(前缀树)组织块,实现自动复用与 LRU 淘汰。
-
【AI 核心深度 M4-062】如何降低 KV Cache 显存?列出主要方法。(Methods to Reduce KV Cache Memory Footprint)深度数理推导与工程落地解析
减少元素数(GQA/MQA/MLA、稀疏/窗口)与减少每元素位数(KV 量化),以及跨请求共享(前缀缓存)与分层策略。