Tag: recurrent-models-rnn-lstm-gru
-
【AI 核心深度 M4-006】RNN 时代有哪些正则化技巧?(Regularization Techniques in the Recurrent Era: Variational Dropout and Zoneout)深度数理推导与工程落地解析
dropout 变体(variational/zoneout)、recurrent dropout、weight noise、以及 embedding dropout 等,核心是’不破坏时间维的递归结构’。
-
【AI 核心深度 M4-001】解释 RNN 的前向与 BPTT,并说明它的主要缺陷(RNN Forward Dynamics, Backpropagation Through Time (BPTT), and Core Limitations)深度数理推导与工程落地解析
隐状态递归 h_t=f(W_h h_{t-1}+W_x x_t);BPTT 沿时间反传,梯度含 W_h 的 T 次连乘,导致梯度消失/爆炸与串行不可并行。
-
【AI 核心深度 M4-002】解释 LSTM 的三个门与细胞状态的加法路径(LSTM: Three Gating Mechanisms and the Additive Cell State Highway)深度数理推导与工程落地解析
遗忘门/输入门/输出门控制细胞状态;c_t=f⊙c_{t−1}+i⊙g 的加性更新给梯度一条近似恒等的直通路径。
-
【AI 核心深度 M4-003】比较 LSTM 与 GRU(Comparing LSTM and GRU: Structural Simplifications and Trade-offs)深度数理推导与工程落地解析
GRU 把 LSTM 的输入门与遗忘门合并为更新门、去掉独立细胞状态,参数更少、速度更快;效果通常相当。
-
【AI 核心深度 M4-004】解释双向 RNN 与它的适用限制(Bidirectional RNNs: Formulation, Information Flow, and Operational Constraints)深度数理推导与工程落地解析
双向 RNN 用前向与后向两条链拼接隐状态,能同时利用左右上下文;但要求整条序列可见,不能用于自回归生成。
-
【AI 核心深度 M4-005】解释梯度裁剪在 RNN 中的必要性(The Absolute Necessity of Gradient Clipping in Recurrent Neural Networks)深度数理推导与工程落地解析
RNN 的梯度含同一矩阵的 T 次幂,谱半径略大于 1 即指数爆炸;裁剪把全局范数限制在上界,是训练稳定的必要条件。