AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M3-060】解释 loss spike 现象与梯度范数的关系及缓解(The Loss Spike Phenomenon: Gradient Norm Correlations, Root Causes, and Mitigations)深度数理推导与工程落地解析
训练中 loss 突然上升(常伴 grad_norm 尖峰),多由特定数据批次或数值问题引起;用回滚、跳过批次、降 lr、裁剪缓解。
【AI 核心深度 M3-061】解释 embedding 与输出层的梯度尺度问题(logit 缩放)(Gradient Scale Mismatch in Embedding and Output Layers: Logit Scaling and Tying)深度数理推导与工程落地解析
输出层 logit 随隐藏维度增大而增大,导致 softmax 梯度饱和、embedding 梯度失衡;用 logit 缩放/μP 修正。
【AI 核心深度 M3-062】解释 per-layer / adaptive 梯度裁剪(AGC)(Per-Layer and Adaptive Gradient Clipping (AGC) Explained)深度数理推导与工程落地解析
逐层按’梯度范数 / 参数范数’的比值裁剪,自适应各层尺度;比全局裁剪更能处理层间梯度失衡。
【AI 核心深度 M3-063】解释为什么梯度噪声是隐式正则化(SGD 的泛化来源)(Why Stochastic Gradient Noise Acts as Implicit Regularization in SGD)深度数理推导与工程落地解析
梯度噪声使参数在极小值附近随机游走,偏好’噪声引起的 loss 上升小’的平坦解;噪声 ∝η/B,是隐式正则。
【AI 核心深度 M3-064】比较 MSE、MAE、Huber 损失(Comparing MSE, MAE, and Huber Loss: Robustness and Target Optimality)深度数理推导与工程落地解析
MSE 对大误差平方惩罚(对离群点敏感、梯度线性);MAE 线性惩罚(对离群点鲁棒、零点不可导);Huber 二者折中。
【AI 核心深度 M3-036】解释 Nesterov 动量与经典动量的差异(Nesterov Accelerated Gradient (NAG) vs Classical Momentum)深度数理推导与工程落地解析
经典动量先按当前梯度更新速度再走;Nesterov 先在’前瞻点’计算梯度再修正,收敛更快、震荡更小。
【AI 核心深度 M3-037】解释 Lion 优化器(符号动量)与它的特点(The Lion Optimizer: Sign Momentum, Memory Efficiency, and Behavioral Characteristics)深度数理推导与工程落地解析
Lion 只保留动量的符号作为更新方向,用符号一致性决定衰减;更省显存、更快,但需更小 lr 与更大权重衰减。
【AI 核心深度 M3-038】解释 Adafactor / 8-bit Adam 如何降低优化器显存(Memory-Efficient Optimizers: Adafactor and 8-bit Adam Explained)深度数理推导与工程落地解析
Adafactor 用梯度的行/列二阶矩低秩近似 v,省到 O(n/d);8-bit Adam 用量化+块缩放把状态压到 1/4。
【AI 核心深度 M3-039】比较 Adagrad / RMSProp / AdaDelta 的思想与 Adagrad 的缺陷(Comparing Adagrad, RMSProp, and AdaDelta: The Diminishing Learning Rate Problem)深度数理推导与工程落地解析
Adagrad 累积所有历史梯度平方(学习率单调衰减→后期停滞);RMSProp 用 EWMA 替代累积;AdaDelta 用参数更新量的 RMS 替代固定 lr。
【AI 核心深度 M3-040】为什么需要 warmup?(Why Learning Rate Warmup is Necessary in Deep Learning)深度数理推导与工程落地解析
初始参数与随机初始化下梯度方向噪声大、Adam 二阶矩估计不可靠;warmup 用小 lr 让统计量收敛,避免早期发散。
【AI 核心深度 M3-041】比较 cosine、step、linear、WSD 调度(Comparing Learning Rate Schedules: Cosine, Step, Linear, and WSD)深度数理推导与工程落地解析
cosine 平滑衰减到 0、step 分段下降、linear 线性衰减、WSD 先稳定后快速衰减;LLM 主流是 cosine 或 WSD。
【AI 核心深度 M3-042】学习率与 batch size 的关系是什么?线性缩放规则(Relationship Between Learning Rate and Batch Size: Linear vs Square-Root Scaling)深度数理推导与工程落地解析
lr 与 batch 近似成正比(线性缩放);但超过临界 batch 后收益饱和,改用 sqrt 缩放。
【AI 核心深度 M3-043】解释学习率预热的另一种动机:Adam 的二阶矩偏差(Alternative Motivation for Warmup: Adam’s Second-Moment Variance Collapse)深度数理推导与工程落地解析
Adam 的 v 是平方梯度的 EWMA,初期低估真实二阶矩,使有效步长偏大;warmup 等 v 收敛后再放大 lr。
【AI 核心深度 M3-044】如何诊断学习率是否合适?(How to Diagnose Learning Rate Suitability: Signals, Metrics, and LR Range Tests)深度数理推导与工程落地解析
看 loss 曲线形态与梯度范数:lr 过大 → loss 震荡/爆炸;过小 → 下降缓慢且后期停滞;用 lr range test 定范围。
【AI 核心深度 M3-045】解释 WSD(warmup-stable-decay)调度为什么适合大模型预训练(Why Warmup-Stable-Decay (WSD) is Ideal for Large Language Model Pre-training)深度数理推导与工程落地解析
warmup 升温、stable 段恒定高 lr 长期探索、decay 段快速退火;stable 段可随时中断续训,decay 决定最终质量。