Tag: machine-learning
-
【AI 核心深度 M4-017】解释 Transformer 的表达能力与理论限制(Theoretical Expressive Power and Computational Limits of Transformers)深度数理推导与工程落地解析
Transformer 是通用函数逼近器但受深度与精度限制;理论结果显示固定精度/深度下无法表达某些电路复杂度类,需对数深度或无限精度。
-
【AI 核心深度 M4-018】解释 Transformer 中的参数分布与显存分布(Parameter and VRAM Memory Distribution in Transformer Architectures)深度数理推导与工程落地解析
参数上 FFN 约占 2/3、注意力约 1/3;训练显存中优化器状态与激活远大于参数本身。
-
【AI 核心深度 M4-019】解释 Pre-LN、Post-LN 与 RMSNorm 在 Transformer 中的选择(Normalization Architecture Choices in Transformers: Pre-LN, Post-LN, and RMSNorm)深度数理推导与工程落地解析
Post-LN 需 warmup、深层不稳;Pre-LN 残差路径纯净、稳定但方差累积需末端 LN;RMSNorm 省均值计算,LLaMA 采用。
-
【AI 核心深度 M4-020】解释 Transformer 的初始化策略与 μP(Transformer Weight Initialization Strategies and Maximal Update Parametrization (μP))深度数理推导与工程落地解析
标准初始化随宽度增大导致激活/更新尺度漂移;μP 给出’随宽度一致的初始化与 lr 缩放’,使超参可跨规模迁移。
-
【AI 核心深度 M3-094】解释深度可分离卷积,为什么它能大幅减少计算(Depthwise Separable Convolutions: Mechanism and Computational Savings)深度数理推导与工程落地解析
把标准卷积分解为逐通道卷积(depthwise)+ 1×1 逐点卷积(pointwise),参数量与 FLOPs 降为约 1/k² + 1/d。
-
【AI 核心深度 M3-095】解释注意力的归纳偏置,以及它与卷积的差异(Inductive Bias in Self-Attention vs Convolution)深度数理推导与工程落地解析
注意力是’内容自适应的全局加权’,无空间/平移先验;卷积是’位置固定的局部权重’,有强平移等变先验。
-
【AI 核心深度 M3-096】解释参数共享的几种形式与作用(Parameter Sharing in Deep Learning: Forms, Mechanisms, and Regularizing Impact)深度数理推导与工程落地解析
权重共享(同层/跨层/跨模态/卷积核滑动)、共享 embedding 与输出层、以及多任务共享骨干;降低参数量并注入先验。
-
【AI 核心深度 M3-097】计算卷积层的参数量与输出尺寸(Calculating Convolutional Layer Parameter Count and Output Spatial Dimensions)深度数理推导与工程落地解析
参数量 = k²·C_in·C_out + C_out(含 bias);输出尺寸 = ⌊(H+2P−k)/S⌋+1。
-
【AI 核心深度 M3-098】解释感受野(receptive field)的递归计算(Recursive Calculation of Receptive Field in Convolutional Networks)深度数理推导与工程落地解析
每层感受野按 r_out=r_in+(k−1)·∏(前面 stride) 递推;stride 使感受野按累积乘积放大。
-
【AI 核心深度 M3-099】解释池化与步长卷积的差异与取舍(Pooling vs Strided Convolutions: Structural and Functional Trade-offs)深度数理推导与工程落地解析
池化(max/avg)无可学习参数、固定下采样;步长卷积可学习、下采样同时变换特征;现代架构偏向步长卷积或可分离下采样。