Tag: module-m4
-
【AI 核心深度 M4-014】写出缩放点积注意力,并解释 √d_k 的作用(Scaled Dot-Product Attention Formula and the Vital Role of the 1/√d_k Factor)深度数理推导与工程落地解析
Attention=softmax(QKᵀ/√d_k)V;除以 √d_k 使 logits 方差与维度无关,避免 softmax 饱和与梯度消失。
-
【AI 核心深度 M4-015】解释 FFN 的作用,以及为什么用 4× 或 8/3× 的中间维度(Role of the Feed-Forward Network (FFN) and the 4x / (8/3)x Hidden Dimension Rationale)深度数理推导与工程落地解析
FFN 是逐位置的两层 MLP,提供非线性与’键值记忆’式的特征变换;4× 是容量经验值,SwiGLU 的 8/3× 用于保持参数量相当。
-
【AI 核心深度 M4-016】解释注意力的多头设计为什么有用(Why Multi-Head Attention (MHA) is Effective: Subspace Projections and Diversity)深度数理推导与工程落地解析
多个头在不同子空间并行做注意力,可捕捉不同关系(语法/语义/位置),并降低单头的表示瓶颈。
-
【AI 核心深度 M4-017】解释 Transformer 的表达能力与理论限制(Theoretical Expressive Power and Computational Limits of Transformers)深度数理推导与工程落地解析
Transformer 是通用函数逼近器但受深度与精度限制;理论结果显示固定精度/深度下无法表达某些电路复杂度类,需对数深度或无限精度。
-
【AI 核心深度 M4-018】解释 Transformer 中的参数分布与显存分布(Parameter and VRAM Memory Distribution in Transformer Architectures)深度数理推导与工程落地解析
参数上 FFN 约占 2/3、注意力约 1/3;训练显存中优化器状态与激活远大于参数本身。
-
【AI 核心深度 M4-019】解释 Pre-LN、Post-LN 与 RMSNorm 在 Transformer 中的选择(Normalization Architecture Choices in Transformers: Pre-LN, Post-LN, and RMSNorm)深度数理推导与工程落地解析
Post-LN 需 warmup、深层不稳;Pre-LN 残差路径纯净、稳定但方差累积需末端 LN;RMSNorm 省均值计算,LLaMA 采用。
-
【AI 核心深度 M4-020】解释 Transformer 的初始化策略与 μP(Transformer Weight Initialization Strategies and Maximal Update Parametrization (μP))深度数理推导与工程落地解析
标准初始化随宽度增大导致激活/更新尺度漂移;μP 给出’随宽度一致的初始化与 lr 缩放’,使超参可跨规模迁移。
-
【AI 核心深度 M4-001】解释 RNN 的前向与 BPTT,并说明它的主要缺陷(RNN Forward Dynamics, Backpropagation Through Time (BPTT), and Core Limitations)深度数理推导与工程落地解析
隐状态递归 h_t=f(W_h h_{t-1}+W_x x_t);BPTT 沿时间反传,梯度含 W_h 的 T 次连乘,导致梯度消失/爆炸与串行不可并行。
-
【AI 核心深度 M4-002】解释 LSTM 的三个门与细胞状态的加法路径(LSTM: Three Gating Mechanisms and the Additive Cell State Highway)深度数理推导与工程落地解析
遗忘门/输入门/输出门控制细胞状态;c_t=f⊙c_{t−1}+i⊙g 的加性更新给梯度一条近似恒等的直通路径。
-
【AI 核心深度 M4-003】比较 LSTM 与 GRU(Comparing LSTM and GRU: Structural Simplifications and Trade-offs)深度数理推导与工程落地解析
GRU 把 LSTM 的输入门与遗忘门合并为更新门、去掉独立细胞状态,参数更少、速度更快;效果通常相当。