Tag: module-m4
-
【AI 核心深度 M4-006】RNN 时代有哪些正则化技巧?(Regularization Techniques in the Recurrent Era: Variational Dropout and Zoneout)深度数理推导与工程落地解析
dropout 变体(variational/zoneout)、recurrent dropout、weight noise、以及 embedding dropout 等,核心是’不破坏时间维的递归结构’。
-
【AI 核心深度 M4-007】解释 Seq2Seq 架构与它的信息瓶颈(Seq2Seq Architecture and the Fixed-Vector Information Bottleneck)深度数理推导与工程落地解析
编码器把整个输入压成固定维向量,解码器从该向量生成输出;瓶颈在于所有信息必须挤进一个固定维状态。
-
【AI 核心深度 M4-008】解释 Bahdanau 注意力的计算流程(Bahdanau Additive Attention: Mathematical Workflow and Architectural Anatomy)深度数理推导与工程落地解析
解码器每步用当前状态与全部编码器状态算相似度、softmax 得权重、加权求和得上下文向量,再与解码状态拼接生成。
-
【AI 核心深度 M4-009】为什么说注意力是“可微的软对齐”?(Why Attention is Characterized as ‘Differentiable Soft Alignment’)深度数理推导与工程落地解析
注意力用 softmax 权重对源位置做加权平均,权重连续可微、可端到端训练;硬对齐(argmax/离散选择)不可微。
-
【AI 核心深度 M4-010】解释 teacher forcing 与 exposure bias(Teacher Forcing and Exposure Bias in Autoregressive Sequence Generation)深度数理推导与工程落地解析
teacher forcing 训练时用真实前缀,推理时用模型自己的输出;训练-推理输入分布不一致导致误差累积(exposure bias)。
-
【AI 核心深度 M4-011】解释 beam search 与它的长度偏置(Beam Search Decoding and Length Bias Normalization)深度数理推导与工程落地解析
beam search 保留 top-k 候选序列逐步扩展;因每步累加对数概率,短序列得分天然更高,需长度归一化校正。
-
【AI 核心深度 M4-012】比较编码器-解码器、仅解码器与仅编码器架构的适用场景(Architectural Paradigms: Encoder-Decoder vs Decoder-Only vs Encoder-Only)深度数理推导与工程落地解析
编码器-解码器适合序列到序列转换;仅编码器适合理解/表示;仅解码器适合生成与通用任务,已成为 LLM 主流。
-
【AI 核心深度 M4-013】完整描述一个 Transformer Block 的组成(Complete Structural Anatomy of a Modern Transformer Block)深度数理推导与工程落地解析
多头自注意力 + 残差 + 归一化,接 FFN + 残差 + 归一化;解码器额外插入交叉注意力;Pre-LN 是现代默认。