Tag: quantization-acceleration
-
【AI 核心深度 M4-106】解释对称量化与非对称量化的差异。(Symmetric vs. Asymmetric Quantization Formulation and Overhead)深度数理推导与工程落地解析
对称量化以 0 为原点(zero_point=0,只有 scale);非对称量化用 (scale, zero_point) 映射任意区间 [min,max]。
-
【AI 核心深度 M4-107】解释 NF4 与 INT4 的差异。(Differences Between NormalFloat4 (NF4) and INT4 in QLoRA)深度数理推导与工程落地解析
INT4 是均匀整数格点;NF4 是’信息论最优’的非均匀格点(按正态分位数分布),更适合权重的高斯分布。
-
【AI 核心深度 M4-108】解释 W8A8 与 W4A16 的差异与取舍。(Weight-Activation Quantization Trade-offs: W8A8 vs. W4A16)深度数理推导与工程落地解析
W8A8 同时量化权重与激活(速度最快但激活难量化);W4A16 只量化权重到 4-bit(精度最稳、显存省 4 倍)。
-
【AI 核心深度 M4-109】解释 KV Cache 量化的收益与风险。(Benefits, Risks, and Outlier Sensitivity in KV Cache Quantization)深度数理推导与工程落地解析
KV cache 是长上下文显存大头;量化到 INT8/INT4 可省 2~4 倍,但 KV 动态且离群方向不同(K per-channel、V per-token)。
-
【AI 核心深度 M4-110】解释批处理、内核融合与算子优化对推理吞吐的影响。(Impact of Batching, Kernel Fusion, and Operator Optimization on Serving Throughput)深度数理推导与工程落地解析
批处理摊薄权重读取(memory-bound 的关键);融合减少中间张量读写;算子优化(如 Flash)提升单算子效率。
-
【AI 核心深度 M4-111】如何系统评估一次推理优化的收益?(Systematic Metric Framework for Evaluating Inference Optimizations: TTFT, TPOT, MFU, and Cost)深度数理推导与工程落地解析
先定位瓶颈(roofline + profiling),再测端到端指标(TTFT/TPOT/吞吐/goodput)与质量(任务指标),并做消融与稳定性验证。
-
【AI 核心深度 M4-112】解释 GPTQ / AWQ / SmoothQuant 三种量化算法的差异。(Comparison of Post-Training Quantization Algorithms: GPTQ, AWQ, and SmoothQuant)深度数理推导与工程落地解析
GPTQ 用二阶(Hessian)逐层最小化量化误差;AWQ 保护激活感知的显著通道;SmoothQuant 把激活难度转移到权重。