Tag: transformer-architecture-anatomy
-
【AI 核心深度 M4-021】解释 Transformer 的残差流(residual stream)视角(The Residual Stream Perspective in Transformer Mechanistic Interpretability)深度数理推导与工程落地解析
把主干看成一条’残差流’向量,每个子层从中读取信息、再把结果加回;这是理解信息流、可解释性与激活操纵的框架。
-
【AI 核心深度 M4-022】解释 Transformer 的深度与宽度权衡(scaling 视角)(Depth vs Width Trade-offs in Transformers: Scaling Laws and Optimal Allocations)深度数理推导与工程落地解析
给定算力,深度与宽度存在最优比;scaling law 显示宽度与深度应大致同比例增长,而非极端偏向一方。
-
【AI 核心深度 M4-023】解释 attention 的 mask 机制(causal / padding / prefix-LM)(Attention Masking Mechanisms: Causal, Padding, and Prefix-LM Masks)深度数理推导与工程落地解析
causal mask 屏蔽未来位置实现自回归;padding mask 屏蔽补齐位;prefix-LM 允许前缀双向、后缀因果。
-
【AI 核心深度 M4-024】解释 Transformer 训练中的稳定性技巧(QK-Norm、logit softcap、z-loss)(Transformer Training Stability Techniques: QK-Norm, Logit Soft-Capping, and Auxiliary Z-Loss)深度数理推导与工程落地解析
QK-Norm 归一化 Q/K 防熵崩塌;logit softcap 限制 logit 幅度;z-loss 惩罚 log-sum-exp 偏离 0,稳定 softmax。
-
【AI 核心深度 M4-013】完整描述一个 Transformer Block 的组成(Complete Structural Anatomy of a Modern Transformer Block)深度数理推导与工程落地解析
多头自注意力 + 残差 + 归一化,接 FFN + 残差 + 归一化;解码器额外插入交叉注意力;Pre-LN 是现代默认。
-
【AI 核心深度 M4-014】写出缩放点积注意力,并解释 √d_k 的作用(Scaled Dot-Product Attention Formula and the Vital Role of the 1/√d_k Factor)深度数理推导与工程落地解析
Attention=softmax(QKᵀ/√d_k)V;除以 √d_k 使 logits 方差与维度无关,避免 softmax 饱和与梯度消失。
-
【AI 核心深度 M4-015】解释 FFN 的作用,以及为什么用 4× 或 8/3× 的中间维度(Role of the Feed-Forward Network (FFN) and the 4x / (8/3)x Hidden Dimension Rationale)深度数理推导与工程落地解析
FFN 是逐位置的两层 MLP,提供非线性与’键值记忆’式的特征变换;4× 是容量经验值,SwiGLU 的 8/3× 用于保持参数量相当。
-
【AI 核心深度 M4-016】解释注意力的多头设计为什么有用(Why Multi-Head Attention (MHA) is Effective: Subspace Projections and Diversity)深度数理推导与工程落地解析
多个头在不同子空间并行做注意力,可捕捉不同关系(语法/语义/位置),并降低单头的表示瓶颈。
-
【AI 核心深度 M4-017】解释 Transformer 的表达能力与理论限制(Theoretical Expressive Power and Computational Limits of Transformers)深度数理推导与工程落地解析
Transformer 是通用函数逼近器但受深度与精度限制;理论结果显示固定精度/深度下无法表达某些电路复杂度类,需对数深度或无限精度。
-
【AI 核心深度 M4-018】解释 Transformer 中的参数分布与显存分布(Parameter and VRAM Memory Distribution in Transformer Architectures)深度数理推导与工程落地解析
参数上 FFN 约占 2/3、注意力约 1/3;训练显存中优化器状态与激活远大于参数本身。