Tag: applied-scientist
-
【AI 核心深度 M3-082】解释大规模训练中的通信瓶颈与优化手段(Communication Bottlenecks in Large-Scale Training and Optimization Strategies)深度数理推导与工程落地解析
通信量(∝参数/激活)与带宽限制导致扩展效率下降;用通信重叠、bucket、拓扑感知、ZeRO/FSDP、量化通信优化。
-
【AI 核心深度 M3-083】解释 FSDP 与 ZeRO 的关系与差异(FSDP vs DeepSpeed ZeRO: Architectural Relationship, Mechanics, and Differences)深度数理推导与工程落地解析
FSDP 是 PyTorch 对 ZeRO-3 的等价实现:参数/梯度/优化器状态全分片;差异在实现、API 与生态集成。
-
【AI 核心深度 M3-084】解释 3D 并行与序列并行(sequence parallelism)(3D Parallelism and Sequence Parallelism (SP) in Large Foundation Models)深度数理推导与工程落地解析
3D 并行 = 数据并行 × 张量并行 × 流水线并行;序列并行把 LayerNorm/dropout 等非 matmul 部分沿序列维切分。
-
【AI 核心深度 M3-085】训练 loss 不下降,你会按什么顺序排查?(Systematic Troubleshooting Workflow When Training Loss Fails to Decrease)深度数理推导与工程落地解析
从’能否过拟合单个 batch’开始,依次查数据/标签、lr、初始化、损失实现、梯度流、结构。
-
【AI 核心深度 M3-086】训练 loss 下降但验证 loss 上升,说明什么?怎么办(Training Loss Decreases While Validation Loss Increases: Diagnosis and Remedies)深度数理推导与工程落地解析
典型过拟合:模型记住训练集但泛化差;对策是加正则、增数据、减容量、早停、数据增强。
-
【AI 核心深度 M3-087】解释 loss 曲线中常见的三种异常形态及其原因(Three Common Loss Curve Anomalies and Their Underlying Root Causes)深度数理推导与工程落地解析
震荡不收敛(lr 过大)、阶梯式跳变(数据/调度问题)、突增后恢复(spike,脏数据/数值)。
-
【AI 核心深度 M3-088】如何判断模型是欠拟合还是过拟合?(How to Diagnose Underfitting vs Overfitting: Signals, Baselines, and Thresholds)深度数理推导与工程落地解析
看训练 loss 水平:训练 loss 高且验证也高=欠拟合;训练 loss 低但验证高=过拟合;两者都低=良好。
-
【AI 核心深度 M3-089】什么是“训练-推理不一致”?列举常见来源(Train-Serving Skew (Training-Inference Inconsistency): Root Causes and Mitigations)深度数理推导与工程落地解析
训练与推理路径不同导致行为差异:dropout/BN 的 train/eval 模式、teacher forcing 与自回归、量化、算子融合。
-
【AI 核心深度 M3-090】解释梯度/激活的统计诊断(激活分布、dead 单元、logit 分布)(Statistical Diagnostics for Gradients and Activations: Distributions, Dead Units, and Logits)深度数理推导与工程落地解析
记录每层激活的均值/方差/零值率、logit 的幅度与熵、梯度范数;异常分布直接指向问题层与成因。
-
【AI 核心深度 M3-091】解释“可复现性”调试:随机种子、确定性算子、数据管道(Reproducibility Debugging in Deep Learning: RNG Seeds, Deterministic Algorithms, and Pipelines)深度数理推导与工程落地解析
固定所有随机源(种子、初始化、数据顺序、增强、dropout)+ 用确定性算子 + 固定环境,才能逐步复现。