Tag: talentme
-
【AI 工业核题 H6】Ring All-Reduce 环形集合通信算法(Ring All-Reduce Distributed Communication)深度实现与原理解析
百度与 NCCL 分布式训练通信基石,将 N 块 GPU 组织为逻辑环,Scatter-Reduce 与 All-Gather 达到通信带宽理论极限。
-
【AI 工业核题 H5】PyTorch 混合精度训练循环骨架(AMP GradScaler)(PyTorch Automatic Mixed Precision (AMP) Workflow)深度实现与原理解析
大厂面试手撕训练骨架标准答案,显式呈现 autocast 上下文、动态损失缩放与跳步更新。
-
【AI 工业核题 H4】EMA(模型权重指数移动平均)(Exponential Moving Average (EMA) of Weights)深度实现与原理解析
平滑权重震荡的泛化神器,生成模型(Diffusion)与自监督学习(BYOL/MoCo)标配。
-
【AI 工业核题 H3】梯度全局范数裁剪(clip_grad_norm_)(Gradient Clipping by Global Norm)深度实现与原理解析
大模型对抗梯度爆炸的生命线,计算所有参数梯度的全局 L2 范数并按比例等比缩放。
-
【AI 工业核题 H2】学习率调度:Linear Warmup + Cosine Annealing(Learning Rate Scheduler: Linear Warmup & Cosine Decay)深度实现与原理解析
现代大模型训练标准范式,初始线性预热保护随机权重,后续余弦退火平滑收敛到极小值。
-
【AI 工业核题 H1】Adam 与 AdamW 优化器(解耦权重衰减)(Adam & AdamW Optimizer from Scratch)深度实现与原理解析
现代深度学习优化器之王,一阶动量二阶方差偏差校正,AdamW 正确解耦 L2 权重衰减。
-
【AI 工业核题 G6】ViT Patch Embedding(图片切片投影与序列化)(Vision Transformer (ViT) Patch Embedding)深度实现与原理解析
An Image is Worth 16×16 Words 原理,将 2D 图像划分为小切片并展平成 1D Token 序列,单次卷积等价实现。
-
【AI 工业核题 G5】Pre-LN Transformer 残差块装配(完整层实现)(Pre-LN Transformer Residual Block Assembly)深度实现与原理解析
现代大模型标配层结构,将 LayerNorm/RMSNorm 置于注意力与 MLP 分支内部,主干保留无损纯净残差流。
-
【AI 工业核题 G4】adaLN-Zero(DiT 扩散模型条件注入)(adaLN-Zero (Adaptive LayerNorm with Zero Init))深度实现与原理解析
Sora / DiT 核心,基于时间步与标签条件动态生成缩放、平移与残差门控参数,全零初始化保证初始等价于恒等映射。
-
【AI 工业核题 G3】MoE Top-K 门控与负载均衡损失(MoE Top-K Routing & Auxiliary Load Balancing Loss)深度实现与原理解析
Mixtral / DeepSeek-V3 核心架构,稀疏门控路由分发,辅助负载均衡损失防止专家饿死坍塌。