AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M4-013】完整描述一个 Transformer Block 的组成(Complete Structural Anatomy of a Modern Transformer Block)深度数理推导与工程落地解析
多头自注意力 + 残差 + 归一化,接 FFN + 残差 + 归一化;解码器额外插入交叉注意力;Pre-LN 是现代默认。
【AI 核心深度 M4-014】写出缩放点积注意力,并解释 √d_k 的作用(Scaled Dot-Product Attention Formula and the Vital Role of the 1/√d_k Factor)深度数理推导与工程落地解析
Attention=softmax(QKᵀ/√d_k)V;除以 √d_k 使 logits 方差与维度无关,避免 softmax 饱和与梯度消失。
【AI 核心深度 M4-015】解释 FFN 的作用,以及为什么用 4× 或 8/3× 的中间维度(Role of the Feed-Forward Network (FFN) and the 4x / (8/3)x Hidden Dimension Rationale)深度数理推导与工程落地解析
FFN 是逐位置的两层 MLP,提供非线性与’键值记忆’式的特征变换;4× 是容量经验值,SwiGLU 的 8/3× 用于保持参数量相当。
【AI 核心深度 M4-016】解释注意力的多头设计为什么有用(Why Multi-Head Attention (MHA) is Effective: Subspace Projections and Diversity)深度数理推导与工程落地解析
多个头在不同子空间并行做注意力,可捕捉不同关系(语法/语义/位置),并降低单头的表示瓶颈。
【AI 核心深度 M4-017】解释 Transformer 的表达能力与理论限制(Theoretical Expressive Power and Computational Limits of Transformers)深度数理推导与工程落地解析
Transformer 是通用函数逼近器但受深度与精度限制;理论结果显示固定精度/深度下无法表达某些电路复杂度类,需对数深度或无限精度。
【AI 核心深度 M4-018】解释 Transformer 中的参数分布与显存分布(Parameter and VRAM Memory Distribution in Transformer Architectures)深度数理推导与工程落地解析
参数上 FFN 约占 2/3、注意力约 1/3;训练显存中优化器状态与激活远大于参数本身。
【AI 核心深度 M4-019】解释 Pre-LN、Post-LN 与 RMSNorm 在 Transformer 中的选择(Normalization Architecture Choices in Transformers: Pre-LN, Post-LN, and RMSNorm)深度数理推导与工程落地解析
Post-LN 需 warmup、深层不稳;Pre-LN 残差路径纯净、稳定但方差累积需末端 LN;RMSNorm 省均值计算,LLaMA 采用。
【AI 核心深度 M4-020】解释 Transformer 的初始化策略与 μP(Transformer Weight Initialization Strategies and Maximal Update Parametrization (μP))深度数理推导与工程落地解析
标准初始化随宽度增大导致激活/更新尺度漂移;μP 给出’随宽度一致的初始化与 lr 缩放’,使超参可跨规模迁移。
【AI 核心深度 M3-094】解释深度可分离卷积,为什么它能大幅减少计算(Depthwise Separable Convolutions: Mechanism and Computational Savings)深度数理推导与工程落地解析
把标准卷积分解为逐通道卷积(depthwise)+ 1×1 逐点卷积(pointwise),参数量与 FLOPs 降为约 1/k² + 1/d。
【AI 核心深度 M3-095】解释注意力的归纳偏置,以及它与卷积的差异(Inductive Bias in Self-Attention vs Convolution)深度数理推导与工程落地解析
注意力是’内容自适应的全局加权’,无空间/平移先验;卷积是’位置固定的局部权重’,有强平移等变先验。
【AI 核心深度 M3-096】解释参数共享的几种形式与作用(Parameter Sharing in Deep Learning: Forms, Mechanisms, and Regularizing Impact)深度数理推导与工程落地解析
权重共享(同层/跨层/跨模态/卷积核滑动)、共享 embedding 与输出层、以及多任务共享骨干;降低参数量并注入先验。
【AI 核心深度 M3-097】计算卷积层的参数量与输出尺寸(Calculating Convolutional Layer Parameter Count and Output Spatial Dimensions)深度数理推导与工程落地解析
参数量 = k²·C_in·C_out + C_out(含 bias);输出尺寸 = ⌊(H+2P−k)/S⌋+1。
【AI 核心深度 M3-098】解释感受野(receptive field)的递归计算(Recursive Calculation of Receptive Field in Convolutional Networks)深度数理推导与工程落地解析
每层感受野按 r_out=r_in+(k−1)·∏(前面 stride) 递推;stride 使感受野按累积乘积放大。
【AI 核心深度 M3-099】解释池化与步长卷积的差异与取舍(Pooling vs Strided Convolutions: Structural and Functional Trade-offs)深度数理推导与工程落地解析
池化(max/avg)无可学习参数、固定下采样;步长卷积可学习、下采样同时变换特征;现代架构偏向步长卷积或可分离下采样。
【AI 核心深度 M3-100】解释平移等变性(equivariance)与不变性(invariance)(Translation Equivariance vs Translation Invariance: Definitions and Roles in CNNs)深度数理推导与工程落地解析
等变:输入平移则输出同样平移(卷积);不变:输入平移则输出不变(全局池化/分类输出)。