Tag: seq2seq-attention-origins
-
【AI 核心深度 M4-007】解释 Seq2Seq 架构与它的信息瓶颈(Seq2Seq Architecture and the Fixed-Vector Information Bottleneck)深度数理推导与工程落地解析
编码器把整个输入压成固定维向量,解码器从该向量生成输出;瓶颈在于所有信息必须挤进一个固定维状态。
-
【AI 核心深度 M4-008】解释 Bahdanau 注意力的计算流程(Bahdanau Additive Attention: Mathematical Workflow and Architectural Anatomy)深度数理推导与工程落地解析
解码器每步用当前状态与全部编码器状态算相似度、softmax 得权重、加权求和得上下文向量,再与解码状态拼接生成。
-
【AI 核心深度 M4-009】为什么说注意力是“可微的软对齐”?(Why Attention is Characterized as ‘Differentiable Soft Alignment’)深度数理推导与工程落地解析
注意力用 softmax 权重对源位置做加权平均,权重连续可微、可端到端训练;硬对齐(argmax/离散选择)不可微。
-
【AI 核心深度 M4-010】解释 teacher forcing 与 exposure bias(Teacher Forcing and Exposure Bias in Autoregressive Sequence Generation)深度数理推导与工程落地解析
teacher forcing 训练时用真实前缀,推理时用模型自己的输出;训练-推理输入分布不一致导致误差累积(exposure bias)。
-
【AI 核心深度 M4-011】解释 beam search 与它的长度偏置(Beam Search Decoding and Length Bias Normalization)深度数理推导与工程落地解析
beam search 保留 top-k 候选序列逐步扩展;因每步累加对数概率,短序列得分天然更高,需长度归一化校正。
-
【AI 核心深度 M4-012】比较编码器-解码器、仅解码器与仅编码器架构的适用场景(Architectural Paradigms: Encoder-Decoder vs Decoder-Only vs Encoder-Only)深度数理推导与工程落地解析
编码器-解码器适合序列到序列转换;仅编码器适合理解/表示;仅解码器适合生成与通用任务,已成为 LLM 主流。