AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M3-101】比较 ViT、Swin、ConvNeXt 的设计哲学(Architectural Design Philosophies: ViT vs Swin Transformer vs ConvNeXt)深度数理推导与工程落地解析
ViT 纯注意力+全局(需大数据);Swin 分层窗口注意力(局部+层次);ConvNeXt 用卷积模仿 Transformer 设计(无注意力)。
【AI 核心深度 M4-001】解释 RNN 的前向与 BPTT,并说明它的主要缺陷(RNN Forward Dynamics, Backpropagation Through Time (BPTT), and Core Limitations)深度数理推导与工程落地解析
隐状态递归 h_t=f(W_h h_{t-1}+W_x x_t);BPTT 沿时间反传,梯度含 W_h 的 T 次连乘,导致梯度消失/爆炸与串行不可并行。
【AI 核心深度 M4-002】解释 LSTM 的三个门与细胞状态的加法路径(LSTM: Three Gating Mechanisms and the Additive Cell State Highway)深度数理推导与工程落地解析
遗忘门/输入门/输出门控制细胞状态;c_t=f⊙c_{t−1}+i⊙g 的加性更新给梯度一条近似恒等的直通路径。
【AI 核心深度 M4-003】比较 LSTM 与 GRU(Comparing LSTM and GRU: Structural Simplifications and Trade-offs)深度数理推导与工程落地解析
GRU 把 LSTM 的输入门与遗忘门合并为更新门、去掉独立细胞状态,参数更少、速度更快;效果通常相当。
【AI 核心深度 M4-004】解释双向 RNN 与它的适用限制(Bidirectional RNNs: Formulation, Information Flow, and Operational Constraints)深度数理推导与工程落地解析
双向 RNN 用前向与后向两条链拼接隐状态,能同时利用左右上下文;但要求整条序列可见,不能用于自回归生成。
【AI 核心深度 M4-005】解释梯度裁剪在 RNN 中的必要性(The Absolute Necessity of Gradient Clipping in Recurrent Neural Networks)深度数理推导与工程落地解析
RNN 的梯度含同一矩阵的 T 次幂,谱半径略大于 1 即指数爆炸;裁剪把全局范数限制在上界,是训练稳定的必要条件。
【AI 核心深度 M3-093】解释瓶颈结构(bottleneck)的作用(The Bottleneck Architecture: Dimensionality Reduction, Expansion, and Efficiency)深度数理推导与工程落地解析
用 1×1 降维→3×3 卷积→1×1 升维,减少计算量;在保持表达能力的同时大幅降低 FLOPs。
【AI 核心深度 M3-079】解释 ZeRO 的三个阶段(ZeRO (Zero Redundancy Optimizer): The Three Sharding Stages Explained)深度数理推导与工程落地解析
ZeRO 分片优化器状态(阶段 1)、梯度(阶段 2)、参数(阶段 3),显存逐级下降、通信逐级增加。
【AI 核心深度 M3-080】解释 all-reduce、all-gather、reduce-scatter 的差异与用途(Collective Communication Primitives: All-Reduce, All-Gather, and Reduce-Scatter)深度数理推导与工程落地解析
all-reduce 全局归约后所有设备得结果;all-gather 汇集各设备数据;reduce-scatter 归约后分片分发。
【AI 核心深度 M3-081】解释梯度累积与数据并行的等价性,以及它们的差异(Gradient Accumulation vs Data Parallelism: Mathematical Equivalence and Nuances)深度数理推导与工程落地解析
梯度累积在时间上累加多个 micro-batch 的梯度再更新,等价于大 batch;数据并行在空间上分卡再 all-reduce。
【AI 核心深度 M3-082】解释大规模训练中的通信瓶颈与优化手段(Communication Bottlenecks in Large-Scale Training and Optimization Strategies)深度数理推导与工程落地解析
通信量(∝参数/激活)与带宽限制导致扩展效率下降;用通信重叠、bucket、拓扑感知、ZeRO/FSDP、量化通信优化。
【AI 核心深度 M3-083】解释 FSDP 与 ZeRO 的关系与差异(FSDP vs DeepSpeed ZeRO: Architectural Relationship, Mechanics, and Differences)深度数理推导与工程落地解析
FSDP 是 PyTorch 对 ZeRO-3 的等价实现:参数/梯度/优化器状态全分片;差异在实现、API 与生态集成。
【AI 核心深度 M3-084】解释 3D 并行与序列并行(sequence parallelism)(3D Parallelism and Sequence Parallelism (SP) in Large Foundation Models)深度数理推导与工程落地解析
3D 并行 = 数据并行 × 张量并行 × 流水线并行;序列并行把 LayerNorm/dropout 等非 matmul 部分沿序列维切分。
【AI 核心深度 M3-085】训练 loss 不下降,你会按什么顺序排查?(Systematic Troubleshooting Workflow When Training Loss Fails to Decrease)深度数理推导与工程落地解析
从’能否过拟合单个 batch’开始,依次查数据/标签、lr、初始化、损失实现、梯度流、结构。
【AI 核心深度 M3-086】训练 loss 下降但验证 loss 上升,说明什么?怎么办(Training Loss Decreases While Validation Loss Increases: Diagnosis and Remedies)深度数理推导与工程落地解析
典型过拟合:模型记住训练集但泛化差;对策是加正则、增数据、减容量、早停、数据增强。