Tag: module-m3
-
【AI 核心深度 M3-094】解释深度可分离卷积,为什么它能大幅减少计算(Depthwise Separable Convolutions: Mechanism and Computational Savings)深度数理推导与工程落地解析
把标准卷积分解为逐通道卷积(depthwise)+ 1×1 逐点卷积(pointwise),参数量与 FLOPs 降为约 1/k² + 1/d。
-
【AI 核心深度 M3-095】解释注意力的归纳偏置,以及它与卷积的差异(Inductive Bias in Self-Attention vs Convolution)深度数理推导与工程落地解析
注意力是’内容自适应的全局加权’,无空间/平移先验;卷积是’位置固定的局部权重’,有强平移等变先验。
-
【AI 核心深度 M3-096】解释参数共享的几种形式与作用(Parameter Sharing in Deep Learning: Forms, Mechanisms, and Regularizing Impact)深度数理推导与工程落地解析
权重共享(同层/跨层/跨模态/卷积核滑动)、共享 embedding 与输出层、以及多任务共享骨干;降低参数量并注入先验。
-
【AI 核心深度 M3-097】计算卷积层的参数量与输出尺寸(Calculating Convolutional Layer Parameter Count and Output Spatial Dimensions)深度数理推导与工程落地解析
参数量 = k²·C_in·C_out + C_out(含 bias);输出尺寸 = ⌊(H+2P−k)/S⌋+1。
-
【AI 核心深度 M3-098】解释感受野(receptive field)的递归计算(Recursive Calculation of Receptive Field in Convolutional Networks)深度数理推导与工程落地解析
每层感受野按 r_out=r_in+(k−1)·∏(前面 stride) 递推;stride 使感受野按累积乘积放大。
-
【AI 核心深度 M3-099】解释池化与步长卷积的差异与取舍(Pooling vs Strided Convolutions: Structural and Functional Trade-offs)深度数理推导与工程落地解析
池化(max/avg)无可学习参数、固定下采样;步长卷积可学习、下采样同时变换特征;现代架构偏向步长卷积或可分离下采样。
-
【AI 核心深度 M3-100】解释平移等变性(equivariance)与不变性(invariance)(Translation Equivariance vs Translation Invariance: Definitions and Roles in CNNs)深度数理推导与工程落地解析
等变:输入平移则输出同样平移(卷积);不变:输入平移则输出不变(全局池化/分类输出)。
-
【AI 核心深度 M3-101】比较 ViT、Swin、ConvNeXt 的设计哲学(Architectural Design Philosophies: ViT vs Swin Transformer vs ConvNeXt)深度数理推导与工程落地解析
ViT 纯注意力+全局(需大数据);Swin 分层窗口注意力(局部+层次);ConvNeXt 用卷积模仿 Transformer 设计(无注意力)。
-
【AI 核心深度 M3-093】解释瓶颈结构(bottleneck)的作用(The Bottleneck Architecture: Dimensionality Reduction, Expansion, and Efficiency)深度数理推导与工程落地解析
用 1×1 降维→3×3 卷积→1×1 升维,减少计算量;在保持表达能力的同时大幅降低 FLOPs。
-
【AI 核心深度 M3-079】解释 ZeRO 的三个阶段(ZeRO (Zero Redundancy Optimizer): The Three Sharding Stages Explained)深度数理推导与工程落地解析
ZeRO 分片优化器状态(阶段 1)、梯度(阶段 2)、参数(阶段 3),显存逐级下降、通信逐级增加。