Tag: distributed-training-basics
-
【AI 核心深度 M3-079】解释 ZeRO 的三个阶段(ZeRO (Zero Redundancy Optimizer): The Three Sharding Stages Explained)深度数理推导与工程落地解析
ZeRO 分片优化器状态(阶段 1)、梯度(阶段 2)、参数(阶段 3),显存逐级下降、通信逐级增加。
-
【AI 核心深度 M3-080】解释 all-reduce、all-gather、reduce-scatter 的差异与用途(Collective Communication Primitives: All-Reduce, All-Gather, and Reduce-Scatter)深度数理推导与工程落地解析
all-reduce 全局归约后所有设备得结果;all-gather 汇集各设备数据;reduce-scatter 归约后分片分发。
-
【AI 核心深度 M3-081】解释梯度累积与数据并行的等价性,以及它们的差异(Gradient Accumulation vs Data Parallelism: Mathematical Equivalence and Nuances)深度数理推导与工程落地解析
梯度累积在时间上累加多个 micro-batch 的梯度再更新,等价于大 batch;数据并行在空间上分卡再 all-reduce。
-
【AI 核心深度 M3-082】解释大规模训练中的通信瓶颈与优化手段(Communication Bottlenecks in Large-Scale Training and Optimization Strategies)深度数理推导与工程落地解析
通信量(∝参数/激活)与带宽限制导致扩展效率下降;用通信重叠、bucket、拓扑感知、ZeRO/FSDP、量化通信优化。
-
【AI 核心深度 M3-083】解释 FSDP 与 ZeRO 的关系与差异(FSDP vs DeepSpeed ZeRO: Architectural Relationship, Mechanics, and Differences)深度数理推导与工程落地解析
FSDP 是 PyTorch 对 ZeRO-3 的等价实现:参数/梯度/优化器状态全分片;差异在实现、API 与生态集成。
-
【AI 核心深度 M3-084】解释 3D 并行与序列并行(sequence parallelism)(3D Parallelism and Sequence Parallelism (SP) in Large Foundation Models)深度数理推导与工程落地解析
3D 并行 = 数据并行 × 张量并行 × 流水线并行;序列并行把 LayerNorm/dropout 等非 matmul 部分沿序列维切分。
-
【AI 核心深度 M3-078】比较数据并行、张量并行、流水线并行(Comparing Distributed Parallelism: Data (DP), Tensor (TP), and Pipeline (PP))深度数理推导与工程落地解析
数据并行复制模型、切分数据;张量并行切分单层权重;流水线并行切分层(按 stage);三者常组合为 3D 并行。