AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M3-031】Adam 与 AdamW 的区别是什么?为什么 AdamW 更正确(Adam vs AdamW: Structural Differences and Why AdamW is Mathematically Correct)深度数理推导与工程落地解析
Adam 把 L2 正则混入梯度(等价于用自适应 lr 缩放的正则);AdamW 解耦权重衰减,直接在参数上乘衰减因子。
【AI 核心深度 M3-032】解释 Adam 的 ε 参数作用,以及它在大模型中的常见取值(Role of the Epsilon Parameter in Adam and Common Settings in Large Models)深度数理推导与工程落地解析
ε 防止 v̂ 为 0 时除零,同时在下界约束步长上界(η/ε);LLM 常用 1e-8,某些低精度训练用 1e-6。
【AI 核心深度 M3-033】比较 SGD+Momentum 与 Adam 的泛化差异(Generalization Differences: SGD with Momentum vs Adam)深度数理推导与工程落地解析
SGD 通常泛化更好(更平的极小值、更强隐式正则);Adam 收敛更快但可能过拟合;大模型因规模与稳定性选 Adam。
【AI 核心深度 M3-007】解释梯度检验(gradient checking)的原理与实现细节(Gradient Checking: Principles, Finite Differences, and Implementation Details)深度数理推导与工程落地解析
用有限差分近似数值梯度,与解析梯度比对;关键是中心差分、相对误差判据与 double 精度。
【AI 核心深度 M3-008】为什么不能全零初始化?(Why All-Zero Weight Initialization Fails in Neural Networks)深度数理推导与工程落地解析
对称性无法打破:同层神经元梯度相同、永远学出相同权重。
【AI 核心深度 M3-009】写出 Xavier 与 Kaiming 初始化的方差,并说明适用激活(Xavier and Kaiming Initialization: Mathematical Variances and Suitable Activations)深度数理推导与工程落地解析
Xavier 适合 tanh/sigmoid,Kaiming 适合 ReLU(考虑半区激活)。
【AI 核心深度 M3-010】解释“方差保持”原则,以及它与梯度稳定的关系(The ‘Variance Preservation’ Principle and Its Relation to Gradient Stability)深度数理推导与工程落地解析
若每层输出方差被放大或缩小,深层会指数爆炸/衰减;保持方差≈1 使梯度尺度稳定。
【AI 核心深度 M3-011】Transformer 中常见的初始化技巧有哪些?(Common Initialization Techniques in Transformers)深度数理推导与工程落地解析
缩放初始化(除以 √(2L))、残差分支小初始化、LayerNorm 前零初始化、输出投影零初始化。
【AI 核心深度 M3-012】什么是 μP(最大更新参数化)?它解决什么问题(Maximal Update Parametrization (μP): Concepts and Hyperparameter Transfer)深度数理推导与工程落地解析
按宽度调整初始化与学习率,使最优超参在不同宽度下可迁移(超参迁移)。
【AI 核心深度 M3-013】比较 Sigmoid、Tanh、ReLU 的优缺点(Comparing Sigmoid, Tanh, and ReLU: Mathematical Properties and Trade-offs)深度数理推导与工程落地解析
Sigmoid/Tanh 饱和导致梯度消失且非零中心;ReLU 不饱和、计算快,但有死亡问题。
【AI 核心深度 M3-014】解释 dying ReLU,以及 LeakyReLU/ELU/GELU 如何缓解(The Dying ReLU Problem and How LeakyReLU, ELU, and GELU Mitigate It)深度数理推导与工程落地解析
负区间梯度为 0 使神经元永久失活;带负斜率或平滑负区间可缓解。
【AI 核心深度 M3-015】为什么 Transformer 用 GELU/SiLU 而不是 ReLU?(Why Modern Transformers Use GELU and SiLU Instead of ReLU)深度数理推导与工程落地解析
平滑激活在 0 附近可导、梯度更稳定,且实验上语言建模效果更好。
【AI 核心深度 M3-016】什么是门控线性单元(GLU)家族?为什么它们有效(The Gated Linear Unit (GLU) Family and Why They Excel in Large Language Models)深度数理推导与工程落地解析
用一路输入作为’门’乘另一路,实现输入依赖的非线性调制;表达力强于单路激活。
【AI 核心深度 M3-017】激活函数的选择如何影响数值稳定性与训练速度?(How Activation Function Choice Impacts Numerical Stability and Training Speed)深度数理推导与工程落地解析
饱和函数数值不稳(梯度消失 + exp 溢出);分段/平滑函数更快;注意 FP16 下的溢出区间。
【AI 核心深度 M3-018】激活函数的平滑性如何影响量化(INT8/INT4)推理的精度?(How Activation Smoothness Impacts INT8/INT4 Quantization Accuracy)深度数理推导与工程落地解析
ReLU 有精确零点、分段线性,量化友好;GELU/SiLU 平滑且分布连续,量化误差更大,需逐 token 动态量化或保留高精度。