Tag: cost-latency-optimization
-
【AI 核心深度 M8-044】解释 LLM 推理的成本构成与优化方向(Explain LLM Inference Cost Breakdown, Roofline Bottlenecks, and Optimization Vectors)深度数理推导与工程落地解析
推理成本 = 算力(prefill 与 decode 的 FLOPs)+ 显存(权重与 KV cache)+ 网络与存储;prefill 偏算力受限、decode 偏显存带宽受限,优化方向随瓶颈不同。
-
【AI 核心深度 M8-045】解释模型路由(model routing)的思路与收益(Explain Model Routing Architecture, Cascading Strategies, and Cost-Quality Optimization)深度数理推导与工程落地解析
按查询难度或成本预算把请求分配到不同规模/不同价格的模型,用便宜模型处理大多数简单请求、只在必要时升级到强模型,在质量约束下最小化平均成本。
-
【AI 核心深度 M8-046】解释语义缓存与精确缓存的差异及风险(Explain Exact Caching vs. Semantic Caching: Architecture, Mechanics, and Hallucination Risks)深度数理推导与工程落地解析
精确缓存按 key(规范化后的完整请求)完全匹配命中;语义缓存按 embedding 相似度命中,能覆盖改写与近义问法,但需相似度阈值并承担答非所问的风险。
-
【AI 核心深度 M8-047】解释批处理(含连续批处理)对吞吐与延迟的双向影响(Explain Batching Dynamics and Continuous Iteration-Level Scheduling: Throughput vs. Latency)深度数理推导与工程落地解析
增大 batch 提高吞吐(摊薄权重读取与 kernel 启动开销)但增加单请求排队与首 token 延迟;连续批处理在 token 级动态组批,兼顾吞吐与延迟。
-
【AI 核心深度 M8-048】解释成本-质量-延迟的三方权衡与决策框架(Explain the Cost-Quality-Latency Trilemma and Constrained Decision Framework in Production ML)深度数理推导与工程落地解析
三者不可同时最优;正确做法是把延迟与质量设为 SLO 硬约束,再在可行解空间中最小化成本,并按场景分层配置而非全局取折中。
-
【AI 核心深度 M8-049】解释推测解码(speculative decoding)的延迟-成本权衡(Explain Speculative Decoding: Mathematical Guarantees, Speedup Dynamics, and Cost Trade-offs)深度数理推导与工程落地解析
用小的 draft 模型一次猜 k 个 token,大模型一次并行验证,接受则一次前进多 token;加速比取决于接受率、draft 长度与验证开销,且输出分布与大模型严格一致。
-
【AI 核心深度 M8-050】解释端到端推理延迟的分解与 SLO 驱动的优化(Explain End-to-End Latency Decomposition and SLO-Driven Optimization for AI Serving)深度数理推导与工程落地解析
端到端延迟 = 排队 + prefill(首 token)+ decode(TPOT × 输出长度)+ 网络与后处理;优化应先定位最大项,再针对性用批处理/缓存/量化/并行化。