Tag: convolution-vision-foundations
-
【AI 核心深度 M3-097】计算卷积层的参数量与输出尺寸(Calculating Convolutional Layer Parameter Count and Output Spatial Dimensions)深度数理推导与工程落地解析
参数量 = k²·C_in·C_out + C_out(含 bias);输出尺寸 = ⌊(H+2P−k)/S⌋+1。
-
【AI 核心深度 M3-098】解释感受野(receptive field)的递归计算(Recursive Calculation of Receptive Field in Convolutional Networks)深度数理推导与工程落地解析
每层感受野按 r_out=r_in+(k−1)·∏(前面 stride) 递推;stride 使感受野按累积乘积放大。
-
【AI 核心深度 M3-099】解释池化与步长卷积的差异与取舍(Pooling vs Strided Convolutions: Structural and Functional Trade-offs)深度数理推导与工程落地解析
池化(max/avg)无可学习参数、固定下采样;步长卷积可学习、下采样同时变换特征;现代架构偏向步长卷积或可分离下采样。
-
【AI 核心深度 M3-100】解释平移等变性(equivariance)与不变性(invariance)(Translation Equivariance vs Translation Invariance: Definitions and Roles in CNNs)深度数理推导与工程落地解析
等变:输入平移则输出同样平移(卷积);不变:输入平移则输出不变(全局池化/分类输出)。
-
【AI 核心深度 M3-101】比较 ViT、Swin、ConvNeXt 的设计哲学(Architectural Design Philosophies: ViT vs Swin Transformer vs ConvNeXt)深度数理推导与工程落地解析
ViT 纯注意力+全局(需大数据);Swin 分层窗口注意力(局部+层次);ConvNeXt 用卷积模仿 Transformer 设计(无注意力)。