Tag: module-m8
-
【AI 核心深度 M8-052】解释模型上线的质量门(quality gate)设计(Explain Quality Gate Design, Statistical Significance, and Subgroup Sliced Evaluations for Model Deployment)深度数理推导与工程落地解析
上线前设自动门禁:整体离线指标不低于基线、关键切片不退化、校准与鲁棒性达标、延迟与成本满足 SLO、公平性与安全通过,任一失败则阻断或需人工放行。
-
【AI 核心深度 M8-053】解释持续训练(CT)的触发条件与治理要点(Explain Continuous Training (CT): Trigger Modalities, Pipeline Governance, and Automated Guardrails)深度数理推导与工程落地解析
触发可为定时、数据量累积、漂移超阈或线上指标下降;治理核心是自动评估+质量门+灰度+自动回滚,避免自动上线劣化模型。
-
【AI 核心深度 M8-054】解释 ML 环境中环境与依赖的可复现性要求(Explain Environment Reproducibility, Deterministic Execution, and Dependency Sealing in ML)深度数理推导与工程落地解析
用容器镜像 + 精确锁定依赖 + 固定随机种子 + 数据版本 + 硬件与驱动描述,保证同一输入在任意时间地点产生同一输出。
-
【AI 核心深度 M8-055】解释 ML 系统技术债的来源与偿还方式(Explain Technical Debt in Machine Learning Systems: CACE Principle, Pipeline Jungles, and Repayment Strategies)深度数理推导与工程落地解析
核心来源是数据依赖纠缠(CACE)、配置债、管道丛林、未版本化数据、反馈环与遗留特征;偿还靠测试、监控、文档、重构与自动化。
-
【AI 核心深度 M8-056】解释优雅降级的设计原则(Explain Architectural Principles and Multi-Tier Resilience Strategies for Graceful Degradation)深度数理推导与工程落地解析
预先定义分级降级路径(强模型→小模型→缓存→规则→静态兜底),保证核心功能可用、失败可观测、可自动恢复,且降级不能静默。
-
【AI 核心深度 M8-057】解释熔断与限流的作用与差异(Explain Circuit Breaking vs. Rate Limiting: Architecture, Algorithms, and Cascade Prevention)深度数理推导与工程落地解析
限流控制进入系统的速率以保护下游;熔断在下游错误率超阈时快速失败、不再调用,冷却后半开探测,避免级联故障与资源耗尽。
-
【AI 核心深度 M8-058】解释超时与重试的设计要点(Explain Timeout Hierarchies, Exponential Backoff, Jitter, and Idempotency in Production Systems)深度数理推导与工程落地解析
超时应小于上游 SLO 且分层递减(下游超时 < 上游超时);重试需指数退避+抖动+次数上限+幂等保证,并区分可重试错误,避免重试风暴。
-
【AI 核心深度 M8-030】解释在线推理服务的核心指标(Explain the Core Metrics, Latency Decomposition, and Goodput for Online Inference Serving)深度数理推导与工程落地解析
延迟(P50/P99 TTFT/TPOT)、吞吐(QPS/tokens/s)、可用性(SLA)、成本(每千 token);以及 goodput。
-
【AI 核心深度 M8-031】解释模型服务的常见部署形态(Explain Common Model Serving Deployment Paradigms and Architectural Patterns)深度数理推导与工程落地解析
在线(低延迟同步)、批处理(高吞吐异步)、流式(持续输入)、边缘(本地);以及’级联/多模型’的组合。
-
【AI 核心深度 M8-032】解释推理引擎(vLLM/Triton/TensorRT)的作用(Explain the Architecture, Roles, and Synergies of Inference Engines: Triton vs. TensorRT vs. vLLM)深度数理推导与工程落地解析
Triton 是多框架服务编排;TensorRT 是算子级图优化与量化;vLLM 专攻 LLM 的高吞吐(PagedAttention)。