Tag: machine-learning
-
【AI 核心深度 M8-050】解释端到端推理延迟的分解与 SLO 驱动的优化(Explain End-to-End Latency Decomposition and SLO-Driven Optimization for AI Serving)深度数理推导与工程落地解析
端到端延迟 = 排队 + prefill(首 token)+ decode(TPOT × 输出长度)+ 网络与后处理;优化应先定位最大项,再针对性用批处理/缓存/量化/并行化。
-
【AI 核心深度 M8-051】解释 ML 的 CI/CD 与传统软件 CI/CD 的差异(Explain the Architectural and Operational Distinctions Between ML CI/CD and Traditional Software CI/CD)深度数理推导与工程落地解析
ML 除代码外还要版本化数据与模型、验证数据与模型(而非仅单元测试)、用离线/在线指标做门禁、并支持回滚模型版本而非仅回滚代码。
-
【AI 核心深度 M8-052】解释模型上线的质量门(quality gate)设计(Explain Quality Gate Design, Statistical Significance, and Subgroup Sliced Evaluations for Model Deployment)深度数理推导与工程落地解析
上线前设自动门禁:整体离线指标不低于基线、关键切片不退化、校准与鲁棒性达标、延迟与成本满足 SLO、公平性与安全通过,任一失败则阻断或需人工放行。
-
【AI 核心深度 M8-053】解释持续训练(CT)的触发条件与治理要点(Explain Continuous Training (CT): Trigger Modalities, Pipeline Governance, and Automated Guardrails)深度数理推导与工程落地解析
触发可为定时、数据量累积、漂移超阈或线上指标下降;治理核心是自动评估+质量门+灰度+自动回滚,避免自动上线劣化模型。
-
【AI 核心深度 M8-054】解释 ML 环境中环境与依赖的可复现性要求(Explain Environment Reproducibility, Deterministic Execution, and Dependency Sealing in ML)深度数理推导与工程落地解析
用容器镜像 + 精确锁定依赖 + 固定随机种子 + 数据版本 + 硬件与驱动描述,保证同一输入在任意时间地点产生同一输出。
-
【AI 核心深度 M8-055】解释 ML 系统技术债的来源与偿还方式(Explain Technical Debt in Machine Learning Systems: CACE Principle, Pipeline Jungles, and Repayment Strategies)深度数理推导与工程落地解析
核心来源是数据依赖纠缠(CACE)、配置债、管道丛林、未版本化数据、反馈环与遗留特征;偿还靠测试、监控、文档、重构与自动化。
-
【AI 核心深度 M8-056】解释优雅降级的设计原则(Explain Architectural Principles and Multi-Tier Resilience Strategies for Graceful Degradation)深度数理推导与工程落地解析
预先定义分级降级路径(强模型→小模型→缓存→规则→静态兜底),保证核心功能可用、失败可观测、可自动恢复,且降级不能静默。
-
【AI 核心深度 M8-057】解释熔断与限流的作用与差异(Explain Circuit Breaking vs. Rate Limiting: Architecture, Algorithms, and Cascade Prevention)深度数理推导与工程落地解析
限流控制进入系统的速率以保护下游;熔断在下游错误率超阈时快速失败、不再调用,冷却后半开探测,避免级联故障与资源耗尽。
-
【AI 核心深度 M8-058】解释超时与重试的设计要点(Explain Timeout Hierarchies, Exponential Backoff, Jitter, and Idempotency in Production Systems)深度数理推导与工程落地解析
超时应小于上游 SLO 且分层递减(下游超时 < 上游超时);重试需指数退避+抖动+次数上限+幂等保证,并区分可重试错误,避免重试风暴。
-
【AI 核心深度 M8-030】解释在线推理服务的核心指标(Explain the Core Metrics, Latency Decomposition, and Goodput for Online Inference Serving)深度数理推导与工程落地解析
延迟(P50/P99 TTFT/TPOT)、吞吐(QPS/tokens/s)、可用性(SLA)、成本(每千 token);以及 goodput。