Tag: training-stability-mixed-precision
-
【AI 核心深度 M3-071】解释 FP16、BF16、FP32 的差异与取舍(Floating-Point Precisions in Deep Learning: FP16, BF16, and FP32 Trade-offs)深度数理推导与工程落地解析
FP32 精度高但慢;FP16 精度高但范围窄(易溢出);BF16 范围与 FP32 同但精度低;大模型训练首选 BF16。
-
【AI 核心深度 M3-072】解释 loss scaling 的机制与动态调整(Loss Scaling Mechanism and Dynamic Adjustment in Mixed Precision)深度数理推导与工程落地解析
FP16 下把 loss 乘 scale 使梯度上移避免下溢,更新前除回;动态调整:溢出则减半、稳定则翻倍。
-
【AI 核心深度 M3-073】训练出现 loss NaN 时如何排查?(Systematic Troubleshooting Workflow When Training Loss Becomes NaN)深度数理推导与工程落地解析
按’先定位首次出现的位置,再分算子/数据/超参’排查:softmax 溢出、除零、lr 过大、脏数据、FP16 上溢。
-
【AI 核心深度 M3-074】哪些算子/操作在低精度下最容易出问题?(Operators Most Prone to Instability Under Low-Precision (FP16/BF16))深度数理推导与工程落地解析
含 exp/log/除法的算子(softmax、LN、CE)、累加归约(attention、matmul)、以及需精确表示小增量的权重更新。
-
【AI 核心深度 M3-075】解释梯度检查点与激活重计算对训练的影响(Gradient Checkpointing (Activation Rematerialization): Memory vs Compute Trade-offs)深度数理推导与工程落地解析
不保存中间激活,反向后向时重新前向计算;用约 33% 额外算力换取激活显存降到 O(√L) 或 O(1)。
-
【AI 核心深度 M3-076】解释 attention 的数值稳定性问题与 Flash Attention 的处理(Attention Numerical Stability and How FlashAttention Solves It)深度数理推导与工程落地解析
attention 需对 L 个元素做 softmax,直接物化会 O(L²) 显存且 FP16 下累加误差大;Flash 用在线 softmax + 分块。
-
【AI 核心深度 M3-077】解释为何混合精度下 LayerNorm / softmax 要保持 FP32(Why LayerNorm and Softmax Must Retain FP32 Precision in Mixed-Precision Training)深度数理推导与工程落地解析
两者都含’归约 + 除法/指数’:FP16 累加误差大、exp 易溢出;保 FP32 计算可保证稳定性,开销可忽略。