Tag: module-m4
-
【AI 核心深度 M4-106】解释对称量化与非对称量化的差异。(Symmetric vs. Asymmetric Quantization Formulation and Overhead)深度数理推导与工程落地解析
对称量化以 0 为原点(zero_point=0,只有 scale);非对称量化用 (scale, zero_point) 映射任意区间 [min,max]。
-
【AI 核心深度 M4-107】解释 NF4 与 INT4 的差异。(Differences Between NormalFloat4 (NF4) and INT4 in QLoRA)深度数理推导与工程落地解析
INT4 是均匀整数格点;NF4 是’信息论最优’的非均匀格点(按正态分位数分布),更适合权重的高斯分布。
-
【AI 核心深度 M4-108】解释 W8A8 与 W4A16 的差异与取舍。(Weight-Activation Quantization Trade-offs: W8A8 vs. W4A16)深度数理推导与工程落地解析
W8A8 同时量化权重与激活(速度最快但激活难量化);W4A16 只量化权重到 4-bit(精度最稳、显存省 4 倍)。
-
【AI 核心深度 M4-109】解释 KV Cache 量化的收益与风险。(Benefits, Risks, and Outlier Sensitivity in KV Cache Quantization)深度数理推导与工程落地解析
KV cache 是长上下文显存大头;量化到 INT8/INT4 可省 2~4 倍,但 KV 动态且离群方向不同(K per-channel、V per-token)。
-
【AI 核心深度 M4-110】解释批处理、内核融合与算子优化对推理吞吐的影响。(Impact of Batching, Kernel Fusion, and Operator Optimization on Serving Throughput)深度数理推导与工程落地解析
批处理摊薄权重读取(memory-bound 的关键);融合减少中间张量读写;算子优化(如 Flash)提升单算子效率。
-
【AI 核心深度 M4-111】如何系统评估一次推理优化的收益?(Systematic Metric Framework for Evaluating Inference Optimizations: TTFT, TPOT, MFU, and Cost)深度数理推导与工程落地解析
先定位瓶颈(roofline + profiling),再测端到端指标(TTFT/TPOT/吞吐/goodput)与质量(任务指标),并做消融与稳定性验证。
-
【AI 核心深度 M4-112】解释 GPTQ / AWQ / SmoothQuant 三种量化算法的差异。(Comparison of Post-Training Quantization Algorithms: GPTQ, AWQ, and SmoothQuant)深度数理推导与工程落地解析
GPTQ 用二阶(Hessian)逐层最小化量化误差;AWQ 保护激活感知的显著通道;SmoothQuant 把激活难度转移到权重。
-
【AI 核心深度 M4-092】解释图神经网络与 Transformer 的关系。(Relationship Between Graph Neural Networks and Transformers)深度数理推导与工程落地解析
Transformer 是全连接图上的注意力 GNN;GNN 是稀疏图上固定/学习权重的注意力;Graph Transformer 用注意力 + 结构编码。
-
【AI 核心深度 M4-093】对比 RNN、CNN、Transformer 在序列建模上的归纳偏置。(Inductive Biases in Sequence Modeling: RNN, CNN, and Transformer)深度数理推导与工程落地解析
RNN 有序列递归偏置(顺序、可变长);CNN 有局部性/平移等变偏置;Transformer 偏置最弱(需数据学结构)。
-
【AI 核心深度 M4-094】什么场景仍应选择 RNN/LSTM?(When to Still Choose RNN/LSTM Over Transformers: Low-Latency Edge, Microcontrollers, and Infinite Streaming)深度数理推导与工程落地解析
流式/在线(O(1) 状态、低延迟)、极长序列且状态可压缩、边缘设备(小模型)、以及强顺序依赖的状态机任务。