Tag: inference-serving-deployment
-
【AI 核心深度 M8-030】解释在线推理服务的核心指标(Explain the Core Metrics, Latency Decomposition, and Goodput for Online Inference Serving)深度数理推导与工程落地解析
延迟(P50/P99 TTFT/TPOT)、吞吐(QPS/tokens/s)、可用性(SLA)、成本(每千 token);以及 goodput。
-
【AI 核心深度 M8-031】解释模型服务的常见部署形态(Explain Common Model Serving Deployment Paradigms and Architectural Patterns)深度数理推导与工程落地解析
在线(低延迟同步)、批处理(高吞吐异步)、流式(持续输入)、边缘(本地);以及’级联/多模型’的组合。
-
【AI 核心深度 M8-032】解释推理引擎(vLLM/Triton/TensorRT)的作用(Explain the Architecture, Roles, and Synergies of Inference Engines: Triton vs. TensorRT vs. vLLM)深度数理推导与工程落地解析
Triton 是多框架服务编排;TensorRT 是算子级图优化与量化;vLLM 专攻 LLM 的高吞吐(PagedAttention)。
-
【AI 核心深度 M8-033】解释灰度发布与影子流量(Explain Canary Deployments, Shadow Traffic, and Safe Model Rollout Strategies)深度数理推导与工程落地解析
灰度:小流量切新版本(按比例/用户/地区);影子:新版本并行接收流量但不返回(对比而不影响用户)。
-
【AI 核心深度 M8-034】解释自动扩缩容的设计要点(Explain the Architectural Principles and Challenges of Machine Learning Autoscaling Systems)深度数理推导与工程落地解析
按指标(QPS/延迟/GPU 利用率)扩缩;关键是冷启动(模型加载慢)、缩容的保守性、以及预测式扩缩容。
-
【AI 核心深度 M8-035】解释模型热更新与零停机部署(Explain Model Hot-Swapping, Atomic Traffic Switching, and Zero-Downtime Deployment)深度数理推导与工程落地解析
新版本在后台加载完成后原子切换;关键是’内存双份’、’连接优雅关闭’与’状态兼容’。
-
【AI 核心深度 M8-036】解释多模型服务(multi-model serving)与模型编排(Explain Multi-Model Serving Architectures, GPU Resource Sharing, and Pipeline Orchestration)深度数理推导与工程落地解析
多模型共享资源(动态加载/卸载、MPS、多租户);编排把多个模型串成流水线(预处理→模型→后处理)。