AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M3-087】解释 loss 曲线中常见的三种异常形态及其原因(Three Common Loss Curve Anomalies and Their Underlying Root Causes)深度数理推导与工程落地解析
震荡不收敛(lr 过大)、阶梯式跳变(数据/调度问题)、突增后恢复(spike,脏数据/数值)。
【AI 核心深度 M3-088】如何判断模型是欠拟合还是过拟合?(How to Diagnose Underfitting vs Overfitting: Signals, Baselines, and Thresholds)深度数理推导与工程落地解析
看训练 loss 水平:训练 loss 高且验证也高=欠拟合;训练 loss 低但验证高=过拟合;两者都低=良好。
【AI 核心深度 M3-089】什么是“训练-推理不一致”?列举常见来源(Train-Serving Skew (Training-Inference Inconsistency): Root Causes and Mitigations)深度数理推导与工程落地解析
训练与推理路径不同导致行为差异:dropout/BN 的 train/eval 模式、teacher forcing 与自回归、量化、算子融合。
【AI 核心深度 M3-090】解释梯度/激活的统计诊断(激活分布、dead 单元、logit 分布)(Statistical Diagnostics for Gradients and Activations: Distributions, Dead Units, and Logits)深度数理推导与工程落地解析
记录每层激活的均值/方差/零值率、logit 的幅度与熵、梯度范数;异常分布直接指向问题层与成因。
【AI 核心深度 M3-091】解释“可复现性”调试:随机种子、确定性算子、数据管道(Reproducibility Debugging in Deep Learning: RNG Seeds, Deterministic Algorithms, and Pipelines)深度数理推导与工程落地解析
固定所有随机源(种子、初始化、数据顺序、增强、dropout)+ 用确定性算子 + 固定环境,才能逐步复现。
【AI 核心深度 M3-092】解释残差连接为什么能训练超深网络(Why Residual Connections Enable Ultra-Deep Network Training)深度数理推导与工程落地解析
残差把映射改为 F(x)+x,使梯度含恒等路径(Jacobian 含 I),避免连乘衰减,并让网络只需学’残差’。
【AI 核心深度 M3-065】解释交叉熵与 BCE 的关系与数值稳定写法(Cross-Entropy vs Binary Cross-Entropy (BCE) and Numerically Stable Implementations)深度数理推导与工程落地解析
BCE 是二分类下的交叉熵特例;实现上把 sigmoid 与 CE 合并为 logits 形式(log-sum-exp)以避免溢出。
【AI 核心深度 M3-066】解释 Focal Loss 的设计动机与公式(Focal Loss: Design Motivation, Mathematical Derivation, and Modulating Factor)深度数理推导与工程落地解析
在 CE 上乘调制因子 (1−p_t)^γ,降低易分样本权重、聚焦难样本;解决单阶段检测的正负样本极度不平衡。
【AI 核心深度 M3-067】对比学习中的 InfoNCE 与 Triplet Loss 有何差异(InfoNCE vs Triplet Loss in Contrastive Learning: Formulations and Information Capacity)深度数理推导与工程落地解析
Triplet 用单个正负样本对构造 margin 排序约束;InfoNCE 用 1 正 N 负的 softmax 分类,负样本越多越接近互信息下界。
【AI 核心深度 M3-068】什么是损失函数与评估指标错配?举例说明(Loss Function and Evaluation Metric Mismatch: Causes, Examples, and Surrogates)深度数理推导与工程落地解析
训练用可微的代理损失、评估用业务指标,两者不一致会导致’训练变好但业务变差’;用可微近似或排序对齐缓解。
【AI 核心深度 M3-069】解释 KL 散度在蒸馏/正则中的使用与它的不对称性(KL Divergence in Distillation and Regularization: The Asymmetry Problem)深度数理推导与工程落地解析
KL(P‖Q) 度量用 Q 编码 P 的额外代价;前向 KL 倾向覆盖(mean-seeking)、反向 KL 倾向众数(mode-seeking)。
【AI 核心深度 M3-070】解释 ranking loss(pairwise / listwise)与它在检索排序中的应用(Ranking Losses in Search and Recommendation: Pointwise, Pairwise, and Listwise)深度数理推导与工程落地解析
pointwise 独立打分、pairwise 优化样本对顺序、listwise 直接优化整个列表的排序指标;检索常用 pairwise/listwise。
【AI 核心深度 M3-071】解释 FP16、BF16、FP32 的差异与取舍(Floating-Point Precisions in Deep Learning: FP16, BF16, and FP32 Trade-offs)深度数理推导与工程落地解析
FP32 精度高但慢;FP16 精度高但范围窄(易溢出);BF16 范围与 FP32 同但精度低;大模型训练首选 BF16。
【AI 核心深度 M3-072】解释 loss scaling 的机制与动态调整(Loss Scaling Mechanism and Dynamic Adjustment in Mixed Precision)深度数理推导与工程落地解析
FP16 下把 loss 乘 scale 使梯度上移避免下溢,更新前除回;动态调整:溢出则减半、稳定则翻倍。
【AI 核心深度 M3-073】训练出现 loss NaN 时如何排查?(Systematic Troubleshooting Workflow When Training Loss Becomes NaN)深度数理推导与工程落地解析
按’先定位首次出现的位置,再分算子/数据/超参’排查:softmax 溢出、除零、lr 过大、脏数据、FP16 上溢。