AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M3-046】解释 One-Cycle / 循环学习率策略(The One-Cycle Policy and Cyclical Learning Rates: Mechanisms and Super-Convergence)深度数理推导与工程落地解析
让 lr 在一个周期内先升后降(呈三角/余弦),配合动量反向变化;可大幅缩短训练时间并提升精度。
【AI 核心深度 M3-047】列举深度学习中主要的正则化手段(Major Regularization Techniques in Deep Learning)深度数理推导与工程落地解析
数据增强、权重衰减、dropout、早停、label smoothing、噪声注入、集成/EMA、Mixup/CutMix 等,按’加先验’分类。
【AI 核心深度 M3-048】解释权重衰减为什么常与学习率解耦(Why Weight Decay is Decoupled from Learning Rate)深度数理推导与工程落地解析
L2 加在梯度里会被自适应 lr 缩放扭曲;解耦衰减直接在参数上乘 (1−ηλ),衰减率恒定可控(AdamW)。
【AI 核心深度 M3-049】什么是 Mixup 与 CutMix?为什么它们有效(Mixup and CutMix Data Augmentations: Mechanisms and Theoretical Foundations)深度数理推导与工程落地解析
Mixup 对样本与标签做线性插值;CutMix 用区域粘贴替换插值;两者都扩展数据分布、平滑决策边界。
【AI 核心深度 M3-034】什么是二阶优化与自然梯度?为什么深度学习不用它们(Second-Order Optimization and Natural Gradient Descent: Why Deep Learning Uses First-Order)深度数理推导与工程落地解析
二阶法用 Hessian(或其近似)预条件梯度;自然梯度用 Fisher 信息矩阵。精度高但每步成本 O(n²)~O(n³),深度网络不可行。
【AI 核心深度 M3-035】Adam 的偏差修正(bias correction)为什么必要?(Why Bias Correction is Mathematically Necessary in Adam)深度数理推导与工程落地解析
m、v 初始化为 0,早期 EWMA 被 0 拉低、严重低估真实矩;除以 (1−β^t) 修正。
【AI 核心深度 M3-022】Pre-LN 与 Post-LN 的区别是什么?为什么现代模型用 Pre-LN(Pre-LN vs Post-LN in Transformers: Structural Differences and Gradient Highway Stability)深度数理推导与工程落地解析
Post-LN 在残差后归一化(原版,深层不稳需 warmup);Pre-LN 在子层前归一化,梯度直通更稳。
【AI 核心深度 M3-023】解释 BatchNorm 在推理时为什么用 running 统计(Why BatchNorm Uses Running Statistics During Inference)深度数理推导与工程落地解析
推理时无 batch(或 batch=1),且需确定性输出;running 统计是训练期 batch 统计的滑动平均。
【AI 核心深度 M3-024】列举归一化层带来的副作用与替代方案(Side Effects of Normalization Layers and Alternative Architectures)深度数理推导与工程落地解析
副作用:依赖 batch(BN)、改变表示尺度、与 dropout 冲突、小 batch 不稳。替代:LN/GN/RMSNorm、Weight Standardization、Fixup。
【AI 核心深度 M3-025】解释 Group Normalization 与它适合的场景(Group Normalization (GN): Mechanism and Applicable Scenarios)深度数理推导与工程落地解析
把通道分组、在组内与空间维度归一化;与 batch 无关,适合小 batch 的检测/分割。
【AI 核心深度 M3-026】解释 Weight Standardization 与它在无 BN 网络中的作用(Weight Standardization and Its Role in Normalizer-Free Networks)深度数理推导与工程落地解析
对权重矩阵做零均值单位方差标准化;改善优化条件,可与 GN 组合替代 BN。
【AI 核心深度 M3-027】解释 QK-Norm 与注意力中的归一化技术(QK-Norm and Normalization Techniques in Transformer Attention)深度数理推导与工程落地解析
对 attention 的 Q、K 做归一化,稳定 logits 尺度;现代 LLM(Gemma/Qwen)采用。
【AI 核心深度 M3-028】解释 DeepNorm 与它如何支持超深 Transformer(DeepNorm: Scaling Transformers to 1,000+ Layers with Theoretical Stability)深度数理推导与工程落地解析
Post-LN 的改进:放大残差(αx+F(x))并按深度缩放初始化;支持 1000 层。
【AI 核心深度 M3-029】解释归一化在推理期的算子融合与它对性能的影响(Normalization Operator Fusion in Inference and Its Impact on Serving Latency)深度数理推导与工程落地解析
把 LN/BN 折进相邻线性层或融合成单个内核,减少内存往返与启动开销。
【AI 核心深度 M3-030】写出 SGD、Momentum、Adam 的更新式(Update Formulas for SGD, SGD with Momentum, and Adam)深度数理推导与工程落地解析
SGD 只用一阶梯度;Momentum 累积历史梯度形成速度;Adam 同时用一阶矩(动量)与二阶矩(自适应步长)。