Tag: module-m4
-
【AI 核心深度 M4-023】解释 attention 的 mask 机制(causal / padding / prefix-LM)(Attention Masking Mechanisms: Causal, Padding, and Prefix-LM Masks)深度数理推导与工程落地解析
causal mask 屏蔽未来位置实现自回归;padding mask 屏蔽补齐位;prefix-LM 允许前缀双向、后缀因果。
-
【AI 核心深度 M4-024】解释 Transformer 训练中的稳定性技巧(QK-Norm、logit softcap、z-loss)(Transformer Training Stability Techniques: QK-Norm, Logit Soft-Capping, and Auxiliary Z-Loss)深度数理推导与工程落地解析
QK-Norm 归一化 Q/K 防熵崩塌;logit softcap 限制 logit 幅度;z-loss 惩罚 log-sum-exp 偏离 0,稳定 softmax。