Tag: ai-operators
-
【AI 工业核题 I3】投机解码(Speculative Decoding 验证与接收拒绝)(Speculative Decoding Verification & Accept/Reject)深度实现与原理解析
小草稿模型极速猜测 K 步,大目标模型单次并行前向验证,保证输出数学分布 100% 无损等价。
-
【AI 工业核题 I2】大模型生成采样器(Temperature + Top-K + Top-P)(LLM Generation Sampler (Temperature, Top-K & Top-P))深度实现与原理解析
现代大模型输出控制核心三剑客,温度调节概率尖锐度,Top-K 截断前 K 项,Top-P 动态核采样累计概率。
-
【AI 工业核题 I1】INT8 仿射与对称量化(Scale 与 Zero-Point)(INT8 Affine & Symmetric Quantization)深度实现与原理解析
模型推理加速标配,浮点 FP32 到低位整数 INT8 的映射与反量化重构。
-
【AI 工业核题 H6】Ring All-Reduce 环形集合通信算法(Ring All-Reduce Distributed Communication)深度实现与原理解析
百度与 NCCL 分布式训练通信基石,将 N 块 GPU 组织为逻辑环,Scatter-Reduce 与 All-Gather 达到通信带宽理论极限。
-
【AI 工业核题 H5】PyTorch 混合精度训练循环骨架(AMP GradScaler)(PyTorch Automatic Mixed Precision (AMP) Workflow)深度实现与原理解析
大厂面试手撕训练骨架标准答案,显式呈现 autocast 上下文、动态损失缩放与跳步更新。
-
【AI 工业核题 H4】EMA(模型权重指数移动平均)(Exponential Moving Average (EMA) of Weights)深度实现与原理解析
平滑权重震荡的泛化神器,生成模型(Diffusion)与自监督学习(BYOL/MoCo)标配。
-
【AI 工业核题 H3】梯度全局范数裁剪(clip_grad_norm_)(Gradient Clipping by Global Norm)深度实现与原理解析
大模型对抗梯度爆炸的生命线,计算所有参数梯度的全局 L2 范数并按比例等比缩放。
-
【AI 工业核题 H2】学习率调度:Linear Warmup + Cosine Annealing(Learning Rate Scheduler: Linear Warmup & Cosine Decay)深度实现与原理解析
现代大模型训练标准范式,初始线性预热保护随机权重,后续余弦退火平滑收敛到极小值。
-
【AI 工业核题 H1】Adam 与 AdamW 优化器(解耦权重衰减)(Adam & AdamW Optimizer from Scratch)深度实现与原理解析
现代深度学习优化器之王,一阶动量二阶方差偏差校正,AdamW 正确解耦 L2 权重衰减。
-
【AI 工业核题 G6】ViT Patch Embedding(图片切片投影与序列化)(Vision Transformer (ViT) Patch Embedding)深度实现与原理解析
An Image is Worth 16×16 Words 原理,将 2D 图像划分为小切片并展平成 1D Token 序列,单次卷积等价实现。