Tag: attention-variants-mha-mqa-gqa
-
【AI 核心深度 M4-035】解释 MQA 与 GQA,以及它们如何降低 KV Cache(Multi-Query Attention (MQA) and Grouped-Query Attention (GQA): Slashing KV-Cache Memory)深度数理推导与工程落地解析
MQA 让所有头共享一组 K/V;GQA 把头分组、组内共享。KV cache 显存与带宽降为 1/h 或 1/g。
-
【AI 核心深度 M4-036】解释 MLA(多头潜在注意力)如何压缩 KV Cache(Multi-Head Latent Attention (MLA): DeepSeek’s Low-Rank KV Cache Compression)深度数理推导与工程落地解析
把 K/V 投影到低维潜在向量再缓存,推理时上投影回多头;KV cache 降为约 1/10,且质量可超过 MHA。
-
【AI 核心深度 M4-037】解释稀疏注意力与滑动窗口注意力(Sparse Attention Mechanisms and Sliding Window Attention (SWA))深度数理推导与工程落地解析
只让每个 token 关注部分位置(局部窗口 / 固定稀疏模式 / 学习式),把 O(L²) 降到 O(L·w) 或 O(L·k)。
-
【AI 核心深度 M4-038】解释线性注意力与核方法的关系(Linear Attention and Kernel Methods: Associative Matrix Multiplication and O(N) Complexity)深度数理推导与工程落地解析
把 softmax 写成核函数 φ(q)·φ(k),则注意力可重排为’先算 KᵀV 再乘 Q’,复杂度降为 O(Ld²)。
-
【AI 核心深度 M4-039】解释差分注意力(Differential Attention)的动机(Differential Attention (Diff Transformer): Design Motivation and Noise Cancellation)深度数理推导与工程落地解析
用两组注意力相减,抵消’注意力噪声/汇聚’,使模型能聚焦信号;DIFF Transformer 用此提升长上下文与抗干扰。
-
【AI 核心深度 M4-040】解释注意力汇聚(attention sink)现象(The Attention Sink Phenomenon: Origins, Mechanics, and StreamingLLM)深度数理推导与工程落地解析
大量注意力集中到序列开头的少数 token(尤其首 token),即使它们语义无关;因 softmax 需’归一化出口’。
-
【AI 核心深度 M4-041】解释 MQA/GQA 的 uptraining 与质量恢复(Uptraining Multi-Head Attention into MQA/GQA: Initialization and Quality Recovery)深度数理推导与工程落地解析
把 MHA 的 K/V 头平均后初始化 MQA/GQA,再用少量训练恢复质量(约 5% 预训练算力)。
-
【AI 核心深度 M4-042】解释 Native Sparse Attention(NSA)的设计(Native Sparse Attention (NSA): Multi-Branch Hardware-Aligned Sparse Design)深度数理推导与工程落地解析
用可学习/硬件对齐的分块稀疏注意力(压缩 + 选择 + 滑动窗口三支路),在长上下文上兼顾质量与加速。
-
【AI 核心深度 M4-043】解释 cross-attention 与 self-attention 的差异与用途(Cross-Attention vs Self-Attention: Structural Differences and Multimodal Roles)深度数理推导与工程落地解析
self-attention 的 Q/K/V 同源(序列内交互);cross-attention 的 Q 来自解码器、K/V 来自编码器(跨序列对齐)。
-
【AI 核心深度 M4-044】解释注意力熵崩塌(entropy collapse)与 QK-Norm 的作用(Attention Entropy Collapse and How QK-Norm Resolves It)深度数理推导与工程落地解析
训练中注意力分布趋于尖锐(熵趋 0)、注意力集中在少数位置,损害长上下文与训练稳定;QK-Norm 归一化 Q/K 抑制它。