Tag: machine-learning
-
【AI 核心深度 M4-007】解释 Seq2Seq 架构与它的信息瓶颈(Seq2Seq Architecture and the Fixed-Vector Information Bottleneck)深度数理推导与工程落地解析
编码器把整个输入压成固定维向量,解码器从该向量生成输出;瓶颈在于所有信息必须挤进一个固定维状态。
-
【AI 核心深度 M4-008】解释 Bahdanau 注意力的计算流程(Bahdanau Additive Attention: Mathematical Workflow and Architectural Anatomy)深度数理推导与工程落地解析
解码器每步用当前状态与全部编码器状态算相似度、softmax 得权重、加权求和得上下文向量,再与解码状态拼接生成。
-
【AI 核心深度 M4-009】为什么说注意力是“可微的软对齐”?(Why Attention is Characterized as ‘Differentiable Soft Alignment’)深度数理推导与工程落地解析
注意力用 softmax 权重对源位置做加权平均,权重连续可微、可端到端训练;硬对齐(argmax/离散选择)不可微。
-
【AI 核心深度 M4-010】解释 teacher forcing 与 exposure bias(Teacher Forcing and Exposure Bias in Autoregressive Sequence Generation)深度数理推导与工程落地解析
teacher forcing 训练时用真实前缀,推理时用模型自己的输出;训练-推理输入分布不一致导致误差累积(exposure bias)。
-
【AI 核心深度 M4-011】解释 beam search 与它的长度偏置(Beam Search Decoding and Length Bias Normalization)深度数理推导与工程落地解析
beam search 保留 top-k 候选序列逐步扩展;因每步累加对数概率,短序列得分天然更高,需长度归一化校正。
-
【AI 核心深度 M4-012】比较编码器-解码器、仅解码器与仅编码器架构的适用场景(Architectural Paradigms: Encoder-Decoder vs Decoder-Only vs Encoder-Only)深度数理推导与工程落地解析
编码器-解码器适合序列到序列转换;仅编码器适合理解/表示;仅解码器适合生成与通用任务,已成为 LLM 主流。
-
【AI 核心深度 M4-013】完整描述一个 Transformer Block 的组成(Complete Structural Anatomy of a Modern Transformer Block)深度数理推导与工程落地解析
多头自注意力 + 残差 + 归一化,接 FFN + 残差 + 归一化;解码器额外插入交叉注意力;Pre-LN 是现代默认。
-
【AI 核心深度 M4-014】写出缩放点积注意力,并解释 √d_k 的作用(Scaled Dot-Product Attention Formula and the Vital Role of the 1/√d_k Factor)深度数理推导与工程落地解析
Attention=softmax(QKᵀ/√d_k)V;除以 √d_k 使 logits 方差与维度无关,避免 softmax 饱和与梯度消失。
-
【AI 核心深度 M4-015】解释 FFN 的作用,以及为什么用 4× 或 8/3× 的中间维度(Role of the Feed-Forward Network (FFN) and the 4x / (8/3)x Hidden Dimension Rationale)深度数理推导与工程落地解析
FFN 是逐位置的两层 MLP,提供非线性与’键值记忆’式的特征变换;4× 是容量经验值,SwiGLU 的 8/3× 用于保持参数量相当。
-
【AI 核心深度 M4-016】解释注意力的多头设计为什么有用(Why Multi-Head Attention (MHA) is Effective: Subspace Projections and Diversity)深度数理推导与工程落地解析
多个头在不同子空间并行做注意力,可捕捉不同关系(语法/语义/位置),并降低单头的表示瓶颈。