Tag: science-depth
-
【AI 核心深度 M4-045】解释 softmax 之外的注意力替代(sigmoid attention、归一化变体)(Alternatives to Softmax Attention: Sigmoid Attention and Normalization Variants)深度数理推导与工程落地解析
用 sigmoid 逐元素门控替代 softmax 的行归一化,去掉’必须分配满权重’的约束,缓解 sink 与熵崩塌。
-
【AI 核心深度 M4-046】解释注意力与外部记忆/检索的融合(kNN-LM、RETRO)(Fusing Attention with External Memory and Retrieval: kNN-LM and RETRO)深度数理推导与工程落地解析
把外部语料库的表示作为额外 key/value 参与预测:kNN-LM 在输出分布上插值检索分布;RETRO 用分块交叉注意力注入检索邻居。
-
【AI 核心深度 M4-047】解释 FlashAttention 的核心思想(IO 感知与分块)(FlashAttention Core Philosophy: IO-Awareness, SRAM Tiling, and Memory Hierarchy)深度数理推导与工程落地解析
注意力是 memory-bound:不物化 L×L 矩阵,用分块 + 在线 softmax 在 SRAM 内完成计算,减少 HBM 读写。
-
【AI 核心深度 M4-048】解释在线 softmax(online softmax)如何支持分块计算(Online Softmax: Enabling Block-by-Block Incremental Attention Tiling)深度数理推导与工程落地解析
逐块处理时维护 running max 与 running sum,用 e^{m_old−m_new} 重缩放已累积结果,实现与全量 softmax 等价。
-
【AI 核心深度 M4-021】解释 Transformer 的残差流(residual stream)视角(The Residual Stream Perspective in Transformer Mechanistic Interpretability)深度数理推导与工程落地解析
把主干看成一条’残差流’向量,每个子层从中读取信息、再把结果加回;这是理解信息流、可解释性与激活操纵的框架。
-
【AI 核心深度 M4-022】解释 Transformer 的深度与宽度权衡(scaling 视角)(Depth vs Width Trade-offs in Transformers: Scaling Laws and Optimal Allocations)深度数理推导与工程落地解析
给定算力,深度与宽度存在最优比;scaling law 显示宽度与深度应大致同比例增长,而非极端偏向一方。
-
【AI 核心深度 M4-023】解释 attention 的 mask 机制(causal / padding / prefix-LM)(Attention Masking Mechanisms: Causal, Padding, and Prefix-LM Masks)深度数理推导与工程落地解析
causal mask 屏蔽未来位置实现自回归;padding mask 屏蔽补齐位;prefix-LM 允许前缀双向、后缀因果。
-
【AI 核心深度 M4-024】解释 Transformer 训练中的稳定性技巧(QK-Norm、logit softcap、z-loss)(Transformer Training Stability Techniques: QK-Norm, Logit Soft-Capping, and Auxiliary Z-Loss)深度数理推导与工程落地解析
QK-Norm 归一化 Q/K 防熵崩塌;logit softcap 限制 logit 幅度;z-loss 惩罚 log-sum-exp 偏离 0,稳定 softmax。