Tag: machine-learning
-
【AI 核心深度 M8-031】解释模型服务的常见部署形态(Explain Common Model Serving Deployment Paradigms and Architectural Patterns)深度数理推导与工程落地解析
在线(低延迟同步)、批处理(高吞吐异步)、流式(持续输入)、边缘(本地);以及’级联/多模型’的组合。
-
【AI 核心深度 M8-032】解释推理引擎(vLLM/Triton/TensorRT)的作用(Explain the Architecture, Roles, and Synergies of Inference Engines: Triton vs. TensorRT vs. vLLM)深度数理推导与工程落地解析
Triton 是多框架服务编排;TensorRT 是算子级图优化与量化;vLLM 专攻 LLM 的高吞吐(PagedAttention)。
-
【AI 核心深度 M8-033】解释灰度发布与影子流量(Explain Canary Deployments, Shadow Traffic, and Safe Model Rollout Strategies)深度数理推导与工程落地解析
灰度:小流量切新版本(按比例/用户/地区);影子:新版本并行接收流量但不返回(对比而不影响用户)。
-
【AI 核心深度 M8-034】解释自动扩缩容的设计要点(Explain the Architectural Principles and Challenges of Machine Learning Autoscaling Systems)深度数理推导与工程落地解析
按指标(QPS/延迟/GPU 利用率)扩缩;关键是冷启动(模型加载慢)、缩容的保守性、以及预测式扩缩容。
-
【AI 核心深度 M8-035】解释模型热更新与零停机部署(Explain Model Hot-Swapping, Atomic Traffic Switching, and Zero-Downtime Deployment)深度数理推导与工程落地解析
新版本在后台加载完成后原子切换;关键是’内存双份’、’连接优雅关闭’与’状态兼容’。
-
【AI 核心深度 M8-036】解释多模型服务(multi-model serving)与模型编排(Explain Multi-Model Serving Architectures, GPU Resource Sharing, and Pipeline Orchestration)深度数理推导与工程落地解析
多模型共享资源(动态加载/卸载、MPS、多租户);编排把多个模型串成流水线(预处理→模型→后处理)。
-
【AI 核心深度 M8-037】解释数据漂移与概念漂移的差异(Explain the Theoretical and Practical Distinctions Between Data Drift and Concept Drift)深度数理推导与工程落地解析
数据漂移:输入分布 P(X) 变化;概念漂移:条件分布 P(Y|X) 变化;两者对策不同。
-
【AI 核心深度 M8-038】列举漂移检测的常用方法(Enumerate and Compare Established Methodologies for Feature and Distribution Drift Detection)深度数理推导与工程落地解析
单变量(PSI/KL/KS/卡方)、多变量(分类器两样本检验)、性能监控、以及’不确定性/置信度’的监控。
-
【AI 核心深度 M8-039】解释监控体系的分层设计(Explain the Four-Layer Architecture for Machine Learning Production Monitoring)深度数理推导与工程落地解析
四层:基础设施(GPU/CPU/网络)→ 服务(延迟/错误/吞吐)→ 模型(输入分布/预测分布/性能)→ 业务(CTR/GMV)。
-
【AI 核心深度 M8-040】解释标签延迟对模型监控的影响(Explain the Impact of Delayed Ground-Truth Feedback on ML Monitoring and Mitigation Strategies)深度数理推导与工程落地解析
标签需时间到达(如’30 天复购’)→ 性能指标滞后;用代理指标、延迟反馈建模、以及’早期信号’缓解。