Tag: module-m4
-
【AI 核心深度 M4-041】解释 MQA/GQA 的 uptraining 与质量恢复(Uptraining Multi-Head Attention into MQA/GQA: Initialization and Quality Recovery)深度数理推导与工程落地解析
把 MHA 的 K/V 头平均后初始化 MQA/GQA,再用少量训练恢复质量(约 5% 预训练算力)。
-
【AI 核心深度 M4-042】解释 Native Sparse Attention(NSA)的设计(Native Sparse Attention (NSA): Multi-Branch Hardware-Aligned Sparse Design)深度数理推导与工程落地解析
用可学习/硬件对齐的分块稀疏注意力(压缩 + 选择 + 滑动窗口三支路),在长上下文上兼顾质量与加速。
-
【AI 核心深度 M4-043】解释 cross-attention 与 self-attention 的差异与用途(Cross-Attention vs Self-Attention: Structural Differences and Multimodal Roles)深度数理推导与工程落地解析
self-attention 的 Q/K/V 同源(序列内交互);cross-attention 的 Q 来自解码器、K/V 来自编码器(跨序列对齐)。
-
【AI 核心深度 M4-044】解释注意力熵崩塌(entropy collapse)与 QK-Norm 的作用(Attention Entropy Collapse and How QK-Norm Resolves It)深度数理推导与工程落地解析
训练中注意力分布趋于尖锐(熵趋 0)、注意力集中在少数位置,损害长上下文与训练稳定;QK-Norm 归一化 Q/K 抑制它。
-
【AI 核心深度 M4-045】解释 softmax 之外的注意力替代(sigmoid attention、归一化变体)(Alternatives to Softmax Attention: Sigmoid Attention and Normalization Variants)深度数理推导与工程落地解析
用 sigmoid 逐元素门控替代 softmax 的行归一化,去掉’必须分配满权重’的约束,缓解 sink 与熵崩塌。
-
【AI 核心深度 M4-046】解释注意力与外部记忆/检索的融合(kNN-LM、RETRO)(Fusing Attention with External Memory and Retrieval: kNN-LM and RETRO)深度数理推导与工程落地解析
把外部语料库的表示作为额外 key/value 参与预测:kNN-LM 在输出分布上插值检索分布;RETRO 用分块交叉注意力注入检索邻居。
-
【AI 核心深度 M4-047】解释 FlashAttention 的核心思想(IO 感知与分块)(FlashAttention Core Philosophy: IO-Awareness, SRAM Tiling, and Memory Hierarchy)深度数理推导与工程落地解析
注意力是 memory-bound:不物化 L×L 矩阵,用分块 + 在线 softmax 在 SRAM 内完成计算,减少 HBM 读写。
-
【AI 核心深度 M4-048】解释在线 softmax(online softmax)如何支持分块计算(Online Softmax: Enabling Block-by-Block Incremental Attention Tiling)深度数理推导与工程落地解析
逐块处理时维护 running max 与 running sum,用 e^{m_old−m_new} 重缩放已累积结果,实现与全量 softmax 等价。
-
【AI 核心深度 M4-021】解释 Transformer 的残差流(residual stream)视角(The Residual Stream Perspective in Transformer Mechanistic Interpretability)深度数理推导与工程落地解析
把主干看成一条’残差流’向量,每个子层从中读取信息、再把结果加回;这是理解信息流、可解释性与激活操纵的框架。
-
【AI 核心深度 M4-022】解释 Transformer 的深度与宽度权衡(scaling 视角)(Depth vs Width Trade-offs in Transformers: Scaling Laws and Optimal Allocations)深度数理推导与工程落地解析
给定算力,深度与宽度存在最优比;scaling law 显示宽度与深度应大致同比例增长,而非极端偏向一方。