Tag: training-diagnostics-debugging
-
【AI 核心深度 M3-085】训练 loss 不下降,你会按什么顺序排查?(Systematic Troubleshooting Workflow When Training Loss Fails to Decrease)深度数理推导与工程落地解析
从’能否过拟合单个 batch’开始,依次查数据/标签、lr、初始化、损失实现、梯度流、结构。
-
【AI 核心深度 M3-086】训练 loss 下降但验证 loss 上升,说明什么?怎么办(Training Loss Decreases While Validation Loss Increases: Diagnosis and Remedies)深度数理推导与工程落地解析
典型过拟合:模型记住训练集但泛化差;对策是加正则、增数据、减容量、早停、数据增强。
-
【AI 核心深度 M3-087】解释 loss 曲线中常见的三种异常形态及其原因(Three Common Loss Curve Anomalies and Their Underlying Root Causes)深度数理推导与工程落地解析
震荡不收敛(lr 过大)、阶梯式跳变(数据/调度问题)、突增后恢复(spike,脏数据/数值)。
-
【AI 核心深度 M3-088】如何判断模型是欠拟合还是过拟合?(How to Diagnose Underfitting vs Overfitting: Signals, Baselines, and Thresholds)深度数理推导与工程落地解析
看训练 loss 水平:训练 loss 高且验证也高=欠拟合;训练 loss 低但验证高=过拟合;两者都低=良好。
-
【AI 核心深度 M3-089】什么是“训练-推理不一致”?列举常见来源(Train-Serving Skew (Training-Inference Inconsistency): Root Causes and Mitigations)深度数理推导与工程落地解析
训练与推理路径不同导致行为差异:dropout/BN 的 train/eval 模式、teacher forcing 与自回归、量化、算子融合。
-
【AI 核心深度 M3-090】解释梯度/激活的统计诊断(激活分布、dead 单元、logit 分布)(Statistical Diagnostics for Gradients and Activations: Distributions, Dead Units, and Logits)深度数理推导与工程落地解析
记录每层激活的均值/方差/零值率、logit 的幅度与熵、梯度范数;异常分布直接指向问题层与成因。
-
【AI 核心深度 M3-091】解释“可复现性”调试:随机种子、确定性算子、数据管道(Reproducibility Debugging in Deep Learning: RNG Seeds, Deterministic Algorithms, and Pipelines)深度数理推导与工程落地解析
固定所有随机源(种子、初始化、数据顺序、增强、dropout)+ 用确定性算子 + 固定环境,才能逐步复现。