Tag: architecture-building-blocks
-
【AI 核心深度 M3-094】解释深度可分离卷积,为什么它能大幅减少计算(Depthwise Separable Convolutions: Mechanism and Computational Savings)深度数理推导与工程落地解析
把标准卷积分解为逐通道卷积(depthwise)+ 1×1 逐点卷积(pointwise),参数量与 FLOPs 降为约 1/k² + 1/d。
-
【AI 核心深度 M3-095】解释注意力的归纳偏置,以及它与卷积的差异(Inductive Bias in Self-Attention vs Convolution)深度数理推导与工程落地解析
注意力是’内容自适应的全局加权’,无空间/平移先验;卷积是’位置固定的局部权重’,有强平移等变先验。
-
【AI 核心深度 M3-096】解释参数共享的几种形式与作用(Parameter Sharing in Deep Learning: Forms, Mechanisms, and Regularizing Impact)深度数理推导与工程落地解析
权重共享(同层/跨层/跨模态/卷积核滑动)、共享 embedding 与输出层、以及多任务共享骨干;降低参数量并注入先验。
-
【AI 核心深度 M3-093】解释瓶颈结构(bottleneck)的作用(The Bottleneck Architecture: Dimensionality Reduction, Expansion, and Efficiency)深度数理推导与工程落地解析
用 1×1 降维→3×3 卷积→1×1 升维,减少计算量;在保持表达能力的同时大幅降低 FLOPs。
-
【AI 核心深度 M3-092】解释残差连接为什么能训练超深网络(Why Residual Connections Enable Ultra-Deep Network Training)深度数理推导与工程落地解析
残差把映射改为 F(x)+x,使梯度含恒等路径(Jacobian 含 I),避免连乘衰减,并让网络只需学’残差’。