Tag: machine-learning
-
【AI 核心深度 M4-090】解释 GNN 在大规模图上的训练策略。(Large-Scale Graph Training Strategies: Node Sampling, Layer Sampling, and Subgraph Partitioning)深度数理推导与工程落地解析
邻居采样(GraphSAGE/邻居爆炸)、子图采样(Cluster-GCN)、以及分布式训练与图分区。
-
【AI 核心深度 M4-091】解释异构图与关系图卷积(R-GCN)。(Heterogeneous Graphs and Relational Graph Convolutional Networks (R-GCN))深度数理推导与工程落地解析
异构图有多种节点/边类型;R-GCN 为每种关系用独立权重矩阵,参数随关系数增长,用基分解/块对角降参。
-
【AI 核心深度 M4-063】解释 chunked prefill 与混合批处理调度。(Chunked Prefill and Piggyback Hybrid Batch Scheduling)深度数理推导与工程落地解析
把长 prompt 的 prefill 切成小块,与 decode 请求混在同一批中,兼顾 TTFT 与吞吐(算力与带宽互补)。
-
【AI 核心深度 M4-064】解释投机解码的变体(Medusa / EAGLE / MTP)。(Speculative Decoding Variants: Medusa, EAGLE, and Multi-Token Prediction)深度数理推导与工程落地解析
Medusa 加多个预测头一次预测多 token;EAGLE 在特征层自回归预测;MTP 在训练时加多 token 预测目标。
-
【AI 核心深度 M4-065】解释推理的吞吐-延迟权衡(TTFT / TPOT / 批大小)。(Throughput vs. Latency Trade-offs in Inference: TTFT, TPOT, and Batch Size)深度数理推导与工程落地解析
增大 batch 提升吞吐但增加单请求延迟(TTFT/TPOT);服务需在 SLO 约束下最大化吞吐。
-
【AI 核心深度 M4-066】解释 PD 分离(prefill-decode disaggregation)。(Prefill-Decode Disaggregation Architecture)深度数理推导与工程落地解析
把 prefill 与 decode 部署在不同实例(各自优化),通过高速网络传 KV cache;消除两阶段互相干扰。
-
【AI 核心深度 M4-067】解释长上下文的主要挑战。(Core Challenges of Scaling to Long Context Windows)深度数理推导与工程落地解析
注意力 O(L²) 计算与 KV cache O(L) 显存、位置编码外推、训练数据稀缺、以及’有效利用’(lost in the middle)四类挑战。
-
【AI 核心深度 M4-068】解释’迷失在中间’(lost in the middle)现象。(The ‘Lost in the Middle’ Phenomenon in Long Context Models)深度数理推导与工程落地解析
模型对长上下文开头与结尾的信息检索能力强,中间位置显著弱;因注意力汇聚在开头、局部窗口在结尾。
-
【AI 核心深度 M4-069】比较长上下文的扩展路线:外推、检索增强、结构改造。(Long Context Scaling Strategies: Length Extrapolation, RAG, and Architectural Redesign)深度数理推导与工程落地解析
外推(位置编码 + 少量微调)最省成本;检索增强(RAG)最经济;结构改造(稀疏/线性/SSM)最根本但需重训。
-
【AI 核心深度 M4-070】解释滑动窗口注意力 + 全局 token 的混合设计。(Hybrid Design of Sliding Window Attention and Global Tokens)深度数理推导与工程落地解析
大部分层用滑窗(局部)省算力,少量全局 token 或全注意力层保证信息能跨长距离流动。