Tag: machine-learning
-
【AI 核心深度 M3-100】解释平移等变性(equivariance)与不变性(invariance)(Translation Equivariance vs Translation Invariance: Definitions and Roles in CNNs)深度数理推导与工程落地解析
等变:输入平移则输出同样平移(卷积);不变:输入平移则输出不变(全局池化/分类输出)。
-
【AI 核心深度 M3-101】比较 ViT、Swin、ConvNeXt 的设计哲学(Architectural Design Philosophies: ViT vs Swin Transformer vs ConvNeXt)深度数理推导与工程落地解析
ViT 纯注意力+全局(需大数据);Swin 分层窗口注意力(局部+层次);ConvNeXt 用卷积模仿 Transformer 设计(无注意力)。
-
【AI 核心深度 M4-001】解释 RNN 的前向与 BPTT,并说明它的主要缺陷(RNN Forward Dynamics, Backpropagation Through Time (BPTT), and Core Limitations)深度数理推导与工程落地解析
隐状态递归 h_t=f(W_h h_{t-1}+W_x x_t);BPTT 沿时间反传,梯度含 W_h 的 T 次连乘,导致梯度消失/爆炸与串行不可并行。
-
【AI 核心深度 M4-002】解释 LSTM 的三个门与细胞状态的加法路径(LSTM: Three Gating Mechanisms and the Additive Cell State Highway)深度数理推导与工程落地解析
遗忘门/输入门/输出门控制细胞状态;c_t=f⊙c_{t−1}+i⊙g 的加性更新给梯度一条近似恒等的直通路径。
-
【AI 核心深度 M4-003】比较 LSTM 与 GRU(Comparing LSTM and GRU: Structural Simplifications and Trade-offs)深度数理推导与工程落地解析
GRU 把 LSTM 的输入门与遗忘门合并为更新门、去掉独立细胞状态,参数更少、速度更快;效果通常相当。
-
【AI 核心深度 M4-004】解释双向 RNN 与它的适用限制(Bidirectional RNNs: Formulation, Information Flow, and Operational Constraints)深度数理推导与工程落地解析
双向 RNN 用前向与后向两条链拼接隐状态,能同时利用左右上下文;但要求整条序列可见,不能用于自回归生成。
-
【AI 核心深度 M4-005】解释梯度裁剪在 RNN 中的必要性(The Absolute Necessity of Gradient Clipping in Recurrent Neural Networks)深度数理推导与工程落地解析
RNN 的梯度含同一矩阵的 T 次幂,谱半径略大于 1 即指数爆炸;裁剪把全局范数限制在上界,是训练稳定的必要条件。
-
【AI 核心深度 M3-093】解释瓶颈结构(bottleneck)的作用(The Bottleneck Architecture: Dimensionality Reduction, Expansion, and Efficiency)深度数理推导与工程落地解析
用 1×1 降维→3×3 卷积→1×1 升维,减少计算量;在保持表达能力的同时大幅降低 FLOPs。
-
【AI 核心深度 M3-079】解释 ZeRO 的三个阶段(ZeRO (Zero Redundancy Optimizer): The Three Sharding Stages Explained)深度数理推导与工程落地解析
ZeRO 分片优化器状态(阶段 1)、梯度(阶段 2)、参数(阶段 3),显存逐级下降、通信逐级增加。
-
【AI 核心深度 M3-080】解释 all-reduce、all-gather、reduce-scatter 的差异与用途(Collective Communication Primitives: All-Reduce, All-Gather, and Reduce-Scatter)深度数理推导与工程落地解析
all-reduce 全局归约后所有设备得结果;all-gather 汇集各设备数据;reduce-scatter 归约后分片分发。