Tag: module-m3
-
【AI 核心深度 M3-072】解释 loss scaling 的机制与动态调整(Loss Scaling Mechanism and Dynamic Adjustment in Mixed Precision)深度数理推导与工程落地解析
FP16 下把 loss 乘 scale 使梯度上移避免下溢,更新前除回;动态调整:溢出则减半、稳定则翻倍。
-
【AI 核心深度 M3-073】训练出现 loss NaN 时如何排查?(Systematic Troubleshooting Workflow When Training Loss Becomes NaN)深度数理推导与工程落地解析
按’先定位首次出现的位置,再分算子/数据/超参’排查:softmax 溢出、除零、lr 过大、脏数据、FP16 上溢。
-
【AI 核心深度 M3-074】哪些算子/操作在低精度下最容易出问题?(Operators Most Prone to Instability Under Low-Precision (FP16/BF16))深度数理推导与工程落地解析
含 exp/log/除法的算子(softmax、LN、CE)、累加归约(attention、matmul)、以及需精确表示小增量的权重更新。
-
【AI 核心深度 M3-075】解释梯度检查点与激活重计算对训练的影响(Gradient Checkpointing (Activation Rematerialization): Memory vs Compute Trade-offs)深度数理推导与工程落地解析
不保存中间激活,反向后向时重新前向计算;用约 33% 额外算力换取激活显存降到 O(√L) 或 O(1)。
-
【AI 核心深度 M3-076】解释 attention 的数值稳定性问题与 Flash Attention 的处理(Attention Numerical Stability and How FlashAttention Solves It)深度数理推导与工程落地解析
attention 需对 L 个元素做 softmax,直接物化会 O(L²) 显存且 FP16 下累加误差大;Flash 用在线 softmax + 分块。
-
【AI 核心深度 M3-077】解释为何混合精度下 LayerNorm / softmax 要保持 FP32(Why LayerNorm and Softmax Must Retain FP32 Precision in Mixed-Precision Training)深度数理推导与工程落地解析
两者都含’归约 + 除法/指数’:FP16 累加误差大、exp 易溢出;保 FP32 计算可保证稳定性,开销可忽略。
-
【AI 核心深度 M3-078】比较数据并行、张量并行、流水线并行(Comparing Distributed Parallelism: Data (DP), Tensor (TP), and Pipeline (PP))深度数理推导与工程落地解析
数据并行复制模型、切分数据;张量并行切分单层权重;流水线并行切分层(按 stage);三者常组合为 3D 并行。
-
【AI 核心深度 M3-050】解释 EMA(指数移动平均)在训练中的作用(The Role of Exponential Moving Average (EMA) of Weights in Training)深度数理推导与工程落地解析
对参数做 EWMA 得到平滑权重,推理用 EMA 权重;降低参数噪声、提升泛化与稳定性,近似模型集成。
-
【AI 核心深度 M3-051】什么是参数平均(SWA)与模型融合?(Stochastic Weight Averaging (SWA) and Weight Ensembling (Model Soups))深度数理推导与工程落地解析
SWA 对轨迹上多点做等权平均,偏向平坦解;模型融合(checkpoint averaging / 集成)平均多个模型的预测或权重。
-
【AI 核心深度 M3-052】解释 label smoothing 的作用与代价(Label Smoothing: Role, Mathematical Mechanism, and Hidden Costs)深度数理推导与工程落地解析
把硬标签替换为软标签(正确类 1−ε、其余 ε/(K−1));抑制过度自信、改善校准,但损失可解释性与蒸馏能力。