Tag: applied-scientist
-
【AI 核心深度 M4-110】解释批处理、内核融合与算子优化对推理吞吐的影响。(Impact of Batching, Kernel Fusion, and Operator Optimization on Serving Throughput)深度数理推导与工程落地解析
批处理摊薄权重读取(memory-bound 的关键);融合减少中间张量读写;算子优化(如 Flash)提升单算子效率。
-
【AI 核心深度 M4-111】如何系统评估一次推理优化的收益?(Systematic Metric Framework for Evaluating Inference Optimizations: TTFT, TPOT, MFU, and Cost)深度数理推导与工程落地解析
先定位瓶颈(roofline + profiling),再测端到端指标(TTFT/TPOT/吞吐/goodput)与质量(任务指标),并做消融与稳定性验证。
-
【AI 核心深度 M4-112】解释 GPTQ / AWQ / SmoothQuant 三种量化算法的差异。(Comparison of Post-Training Quantization Algorithms: GPTQ, AWQ, and SmoothQuant)深度数理推导与工程落地解析
GPTQ 用二阶(Hessian)逐层最小化量化误差;AWQ 保护激活感知的显著通道;SmoothQuant 把激活难度转移到权重。
-
【AI 核心深度 M4-092】解释图神经网络与 Transformer 的关系。(Relationship Between Graph Neural Networks and Transformers)深度数理推导与工程落地解析
Transformer 是全连接图上的注意力 GNN;GNN 是稀疏图上固定/学习权重的注意力;Graph Transformer 用注意力 + 结构编码。
-
【AI 核心深度 M4-093】对比 RNN、CNN、Transformer 在序列建模上的归纳偏置。(Inductive Biases in Sequence Modeling: RNN, CNN, and Transformer)深度数理推导与工程落地解析
RNN 有序列递归偏置(顺序、可变长);CNN 有局部性/平移等变偏置;Transformer 偏置最弱(需数据学结构)。
-
【AI 核心深度 M4-094】什么场景仍应选择 RNN/LSTM?(When to Still Choose RNN/LSTM Over Transformers: Low-Latency Edge, Microcontrollers, and Infinite Streaming)深度数理推导与工程落地解析
流式/在线(O(1) 状态、低延迟)、极长序列且状态可压缩、边缘设备(小模型)、以及强顺序依赖的状态机任务。
-
【AI 核心深度 M4-095】如何为长序列任务选择架构?(Architecture Selection Guide for Long-Sequence Tasks)深度数理推导与工程落地解析
按’是否需要精确检索、序列长度、算力/延迟约束’决策:需检索用注意力(或混合),纯统计用 SSM,超长用稀疏/线性。
-
【AI 核心深度 M4-096】解释位置敏感任务与位置无关任务对架构的不同要求。(Architectural Requirements for Order-Sensitive vs. Order-Invariant Tasks)深度数理推导与工程落地解析
位置敏感任务(检索、复制、算术)需强位置信息(RoPE/位置编码);位置无关任务(分类、情感)可弱化位置。
-
【AI 核心深度 M4-097】如何评估长序列模型的真实能力?(Systematic Evaluation of Long-Context Models: Beyond Needle-in-a-Haystack to RULER and Reasoning)深度数理推导与工程落地解析
用多任务基准(RULER:检索/多跳/聚合/QA)+ 不同位置与长度的热力图 + 与’仅局部基线’对比,而非只看 PPL。
-
【AI 核心深度 M4-098】解释序列模型的长度外推与长度泛化。(Length Extrapolation vs. Length Generalization in Sequence Models)深度数理推导与工程落地解析
外推指超出训练长度的表现;长度泛化指能否处理任意长度(含训练内插)。二者都受位置编码与注意力模式限制。