Tag: machine-learning
-
【AI 核心深度 M8-019】解释批处理与流处理的差异与选型(Explain the Architectural Differences and Selection Criteria Between Batch and Stream Processing)深度数理推导与工程落地解析
批处理(高吞吐、高延迟、可重跑)vs 流处理(低延迟、逐条、状态管理复杂);按’延迟需求’选。
-
【AI 核心深度 M8-020】解释数据质量监控的维度与手段(Explain the Dimensions and Technical Implementation of Data Quality Monitoring)深度数理推导与工程落地解析
维度:完整性/准确性/一致性/及时性/唯一性;手段:任务内断言、事后监控、分布对比、异常检测。
-
【AI 核心深度 M8-021】解释大规模去重的工程实现(Explain the Engineering Implementation of Large-Scale Data Deduplication)深度数理推导与工程落地解析
精确去重(哈希/子串)与近似去重(MinHash+LSH/SimHash);工程上需分布式、亚线性、可增量。
-
【AI 核心深度 M8-022】解释数据血缘与可追溯性的价值(Explain the Strategic Value and Technical Architecture of Data Lineage and Traceability)深度数理推导与工程落地解析
记录’数据从哪来、经过什么加工、被谁使用’;用于影响分析、故障定位、合规审计与复现。
-
【AI 核心深度 M8-023】解释数据版本管理与快照(Explain Data Versioning and Snapshot Management in Modern ML Infrastructure)深度数理推导与工程落地解析
对数据集打版本(含 schema、内容、加工逻辑);支持’可复现’(回到某版本)、’可对比’与’可回滚’。
-
【AI 核心深度 M8-024】解释流批一体的架构(Lambda vs Kappa)(Explain Unified Stream and Batch Architectures: Lambda vs. Kappa vs. Modern Unified Engines)深度数理推导与工程落地解析
Lambda:批处理层(准确)+ 速度层(低延迟)+ 服务层;Kappa:只用流处理(重放历史);流批一体引擎统一两者。
-
【AI 核心深度 M8-025】解释实验管理需要记录哪些信息(Explain the Essential Information and Metadata Required for Rigorous ML Experiment Tracking)深度数理推导与工程落地解析
代码版本、数据版本、超参、环境、随机种子、指标曲线、产物;目标是’可复现 + 可对比 + 可追溯’。
-
【AI 核心深度 M8-002】设计一个商品搜索相关性系统,说明各层设计(Design an End-to-End E-Commerce Search Relevance and Ranking System)深度数理推导与工程落地解析
查询理解 → 多路召回 → 粗排/精排/重排 → 结果呈现;每层有延迟预算、评估指标与失败处理。
-
【AI 核心深度 M8-003】设计一个推荐系统,说明数据与模型选型(Design an End-to-End Recommender System: Data Architecture, Candidate Generation, and Ranking Models)深度数理推导与工程落地解析
多路召回(i2i/u2i/热门)→ 粗排 → 多目标精排(MMoE)→ 重排(多样性/业务);数据含行为日志与画像。
-
【AI 核心深度 M8-004】设计一个 LLM 应用系统(RAG 问答),说明关键决策(Design an Enterprise Retrieval-Augmented Generation (RAG) System and Critical Engineering Trade-Offs)深度数理推导与工程落地解析
索引(切分/嵌入/建库)→ 检索(改写/召回/重排)→ 生成(上下文/引用/校验)→ 监控(忠实度/成本)。