Tag: data-pipelines-streaming
-
【AI 核心深度 M8-018】描述一个典型离线数据管道(Describe the Architecture and Engineering Principles of a Typical Offline Data Pipeline)深度数理推导与工程落地解析
采集 → 清洗 → 转换 → 聚合 → 存储 → 特征/训练集;关键是幂等、可重跑、可观测与血缘。
-
【AI 核心深度 M8-019】解释批处理与流处理的差异与选型(Explain the Architectural Differences and Selection Criteria Between Batch and Stream Processing)深度数理推导与工程落地解析
批处理(高吞吐、高延迟、可重跑)vs 流处理(低延迟、逐条、状态管理复杂);按’延迟需求’选。
-
【AI 核心深度 M8-020】解释数据质量监控的维度与手段(Explain the Dimensions and Technical Implementation of Data Quality Monitoring)深度数理推导与工程落地解析
维度:完整性/准确性/一致性/及时性/唯一性;手段:任务内断言、事后监控、分布对比、异常检测。
-
【AI 核心深度 M8-021】解释大规模去重的工程实现(Explain the Engineering Implementation of Large-Scale Data Deduplication)深度数理推导与工程落地解析
精确去重(哈希/子串)与近似去重(MinHash+LSH/SimHash);工程上需分布式、亚线性、可增量。
-
【AI 核心深度 M8-022】解释数据血缘与可追溯性的价值(Explain the Strategic Value and Technical Architecture of Data Lineage and Traceability)深度数理推导与工程落地解析
记录’数据从哪来、经过什么加工、被谁使用’;用于影响分析、故障定位、合规审计与复现。
-
【AI 核心深度 M8-023】解释数据版本管理与快照(Explain Data Versioning and Snapshot Management in Modern ML Infrastructure)深度数理推导与工程落地解析
对数据集打版本(含 schema、内容、加工逻辑);支持’可复现’(回到某版本)、’可对比’与’可回滚’。
-
【AI 核心深度 M8-024】解释流批一体的架构(Lambda vs Kappa)(Explain Unified Stream and Batch Architectures: Lambda vs. Kappa vs. Modern Unified Engines)深度数理推导与工程落地解析
Lambda:批处理层(准确)+ 速度层(低延迟)+ 服务层;Kappa:只用流处理(重放历史);流批一体引擎统一两者。