Tag: module-m3
-
【AI 核心深度 M3-090】解释梯度/激活的统计诊断(激活分布、dead 单元、logit 分布)(Statistical Diagnostics for Gradients and Activations: Distributions, Dead Units, and Logits)深度数理推导与工程落地解析
记录每层激活的均值/方差/零值率、logit 的幅度与熵、梯度范数;异常分布直接指向问题层与成因。
-
【AI 核心深度 M3-091】解释“可复现性”调试:随机种子、确定性算子、数据管道(Reproducibility Debugging in Deep Learning: RNG Seeds, Deterministic Algorithms, and Pipelines)深度数理推导与工程落地解析
固定所有随机源(种子、初始化、数据顺序、增强、dropout)+ 用确定性算子 + 固定环境,才能逐步复现。
-
【AI 核心深度 M3-092】解释残差连接为什么能训练超深网络(Why Residual Connections Enable Ultra-Deep Network Training)深度数理推导与工程落地解析
残差把映射改为 F(x)+x,使梯度含恒等路径(Jacobian 含 I),避免连乘衰减,并让网络只需学’残差’。
-
【AI 核心深度 M3-065】解释交叉熵与 BCE 的关系与数值稳定写法(Cross-Entropy vs Binary Cross-Entropy (BCE) and Numerically Stable Implementations)深度数理推导与工程落地解析
BCE 是二分类下的交叉熵特例;实现上把 sigmoid 与 CE 合并为 logits 形式(log-sum-exp)以避免溢出。
-
【AI 核心深度 M3-066】解释 Focal Loss 的设计动机与公式(Focal Loss: Design Motivation, Mathematical Derivation, and Modulating Factor)深度数理推导与工程落地解析
在 CE 上乘调制因子 (1−p_t)^γ,降低易分样本权重、聚焦难样本;解决单阶段检测的正负样本极度不平衡。
-
【AI 核心深度 M3-067】对比学习中的 InfoNCE 与 Triplet Loss 有何差异(InfoNCE vs Triplet Loss in Contrastive Learning: Formulations and Information Capacity)深度数理推导与工程落地解析
Triplet 用单个正负样本对构造 margin 排序约束;InfoNCE 用 1 正 N 负的 softmax 分类,负样本越多越接近互信息下界。
-
【AI 核心深度 M3-068】什么是损失函数与评估指标错配?举例说明(Loss Function and Evaluation Metric Mismatch: Causes, Examples, and Surrogates)深度数理推导与工程落地解析
训练用可微的代理损失、评估用业务指标,两者不一致会导致’训练变好但业务变差’;用可微近似或排序对齐缓解。
-
【AI 核心深度 M3-069】解释 KL 散度在蒸馏/正则中的使用与它的不对称性(KL Divergence in Distillation and Regularization: The Asymmetry Problem)深度数理推导与工程落地解析
KL(P‖Q) 度量用 Q 编码 P 的额外代价;前向 KL 倾向覆盖(mean-seeking)、反向 KL 倾向众数(mode-seeking)。
-
【AI 核心深度 M3-070】解释 ranking loss(pairwise / listwise)与它在检索排序中的应用(Ranking Losses in Search and Recommendation: Pointwise, Pairwise, and Listwise)深度数理推导与工程落地解析
pointwise 独立打分、pairwise 优化样本对顺序、listwise 直接优化整个列表的排序指标;检索常用 pairwise/listwise。
-
【AI 核心深度 M3-071】解释 FP16、BF16、FP32 的差异与取舍(Floating-Point Precisions in Deep Learning: FP16, BF16, and FP32 Trade-offs)深度数理推导与工程落地解析
FP32 精度高但慢;FP16 精度高但范围窄(易溢出);BF16 范围与 FP32 同但精度低;大模型训练首选 BF16。