Tag: module-m3
-
【AI 核心深度 M3-080】解释 all-reduce、all-gather、reduce-scatter 的差异与用途(Collective Communication Primitives: All-Reduce, All-Gather, and Reduce-Scatter)深度数理推导与工程落地解析
all-reduce 全局归约后所有设备得结果;all-gather 汇集各设备数据;reduce-scatter 归约后分片分发。
-
【AI 核心深度 M3-081】解释梯度累积与数据并行的等价性,以及它们的差异(Gradient Accumulation vs Data Parallelism: Mathematical Equivalence and Nuances)深度数理推导与工程落地解析
梯度累积在时间上累加多个 micro-batch 的梯度再更新,等价于大 batch;数据并行在空间上分卡再 all-reduce。
-
【AI 核心深度 M3-082】解释大规模训练中的通信瓶颈与优化手段(Communication Bottlenecks in Large-Scale Training and Optimization Strategies)深度数理推导与工程落地解析
通信量(∝参数/激活)与带宽限制导致扩展效率下降;用通信重叠、bucket、拓扑感知、ZeRO/FSDP、量化通信优化。
-
【AI 核心深度 M3-083】解释 FSDP 与 ZeRO 的关系与差异(FSDP vs DeepSpeed ZeRO: Architectural Relationship, Mechanics, and Differences)深度数理推导与工程落地解析
FSDP 是 PyTorch 对 ZeRO-3 的等价实现:参数/梯度/优化器状态全分片;差异在实现、API 与生态集成。
-
【AI 核心深度 M3-084】解释 3D 并行与序列并行(sequence parallelism)(3D Parallelism and Sequence Parallelism (SP) in Large Foundation Models)深度数理推导与工程落地解析
3D 并行 = 数据并行 × 张量并行 × 流水线并行;序列并行把 LayerNorm/dropout 等非 matmul 部分沿序列维切分。
-
【AI 核心深度 M3-085】训练 loss 不下降,你会按什么顺序排查?(Systematic Troubleshooting Workflow When Training Loss Fails to Decrease)深度数理推导与工程落地解析
从’能否过拟合单个 batch’开始,依次查数据/标签、lr、初始化、损失实现、梯度流、结构。
-
【AI 核心深度 M3-086】训练 loss 下降但验证 loss 上升,说明什么?怎么办(Training Loss Decreases While Validation Loss Increases: Diagnosis and Remedies)深度数理推导与工程落地解析
典型过拟合:模型记住训练集但泛化差;对策是加正则、增数据、减容量、早停、数据增强。
-
【AI 核心深度 M3-087】解释 loss 曲线中常见的三种异常形态及其原因(Three Common Loss Curve Anomalies and Their Underlying Root Causes)深度数理推导与工程落地解析
震荡不收敛(lr 过大)、阶梯式跳变(数据/调度问题)、突增后恢复(spike,脏数据/数值)。
-
【AI 核心深度 M3-088】如何判断模型是欠拟合还是过拟合?(How to Diagnose Underfitting vs Overfitting: Signals, Baselines, and Thresholds)深度数理推导与工程落地解析
看训练 loss 水平:训练 loss 高且验证也高=欠拟合;训练 loss 低但验证高=过拟合;两者都低=良好。
-
【AI 核心深度 M3-089】什么是“训练-推理不一致”?列举常见来源(Train-Serving Skew (Training-Inference Inconsistency): Root Causes and Mitigations)深度数理推导与工程落地解析
训练与推理路径不同导致行为差异:dropout/BN 的 train/eval 模式、teacher forcing 与自回归、量化、算子融合。