Tag: science-depth
-
【AI 核心深度 M3-074】哪些算子/操作在低精度下最容易出问题?(Operators Most Prone to Instability Under Low-Precision (FP16/BF16))深度数理推导与工程落地解析
含 exp/log/除法的算子(softmax、LN、CE)、累加归约(attention、matmul)、以及需精确表示小增量的权重更新。
-
【AI 核心深度 M3-075】解释梯度检查点与激活重计算对训练的影响(Gradient Checkpointing (Activation Rematerialization): Memory vs Compute Trade-offs)深度数理推导与工程落地解析
不保存中间激活,反向后向时重新前向计算;用约 33% 额外算力换取激活显存降到 O(√L) 或 O(1)。
-
【AI 核心深度 M3-076】解释 attention 的数值稳定性问题与 Flash Attention 的处理(Attention Numerical Stability and How FlashAttention Solves It)深度数理推导与工程落地解析
attention 需对 L 个元素做 softmax,直接物化会 O(L²) 显存且 FP16 下累加误差大;Flash 用在线 softmax + 分块。
-
【AI 核心深度 M3-077】解释为何混合精度下 LayerNorm / softmax 要保持 FP32(Why LayerNorm and Softmax Must Retain FP32 Precision in Mixed-Precision Training)深度数理推导与工程落地解析
两者都含’归约 + 除法/指数’:FP16 累加误差大、exp 易溢出;保 FP32 计算可保证稳定性,开销可忽略。
-
【AI 核心深度 M3-078】比较数据并行、张量并行、流水线并行(Comparing Distributed Parallelism: Data (DP), Tensor (TP), and Pipeline (PP))深度数理推导与工程落地解析
数据并行复制模型、切分数据;张量并行切分单层权重;流水线并行切分层(按 stage);三者常组合为 3D 并行。
-
【AI 核心深度 M3-050】解释 EMA(指数移动平均)在训练中的作用(The Role of Exponential Moving Average (EMA) of Weights in Training)深度数理推导与工程落地解析
对参数做 EWMA 得到平滑权重,推理用 EMA 权重;降低参数噪声、提升泛化与稳定性,近似模型集成。
-
【AI 核心深度 M3-051】什么是参数平均(SWA)与模型融合?(Stochastic Weight Averaging (SWA) and Weight Ensembling (Model Soups))深度数理推导与工程落地解析
SWA 对轨迹上多点做等权平均,偏向平坦解;模型融合(checkpoint averaging / 集成)平均多个模型的预测或权重。
-
【AI 核心深度 M3-052】解释 label smoothing 的作用与代价(Label Smoothing: Role, Mathematical Mechanism, and Hidden Costs)深度数理推导与工程落地解析
把硬标签替换为软标签(正确类 1−ε、其余 ε/(K−1));抑制过度自信、改善校准,但损失可解释性与蒸馏能力。
-
【AI 核心深度 M3-053】解释 dropout 在 Transformer / LLM 中的使用差异(Dropout Usage in Transformers and LLMs: Differences Across Modalities and Scales)深度数理推导与工程落地解析
小模型/CV/微调用 dropout(0.1);大 LLM 预训练几乎不用(数据充足、显存开销大、与 LN 功能重叠)。
-
【AI 核心深度 M3-054】解释梯度消失与爆炸的成因与缓解(Vanishing and Exploding Gradients: Root Causes, Dynamics, and Modern Mitigations)深度数理推导与工程落地解析
深层链式相乘使梯度按层数指数衰减/放大;用残差、归一化、合理初始化、门控(LSTM)与梯度裁剪缓解。