Tag: dl_kernel
-
【AI 工业核题 D6】FlashAttention Online Softmax 概念手撕(分块增量归一化)(FlashAttention Online Softmax Block-wise Algorithm)深度实现与原理解析
Tri Dao 经典突破,SRAM 分块平铺计算与指数动量增量合并,避免向 HBM 回写 N×N 注意力矩阵。
-
【AI 工业核题 B5】Inverted Dropout(倒置丢弃法与缩放因子)(Inverted Dropout with Train/Eval Scaling)深度实现与原理解析
训练期按 1/(1-p) 进行倒置缩放,保证输出数学期望在训练与推理期恒定一致,使推理期实现完全零计算开销。
-
【AI 工业核题 B4】GroupNorm 与 InstanceNorm(分组与实例归一化)(Group Normalization & Instance Normalization)深度实现与原理解析
何恺明团队经典架构,将通道划分为 G 个组独立归一化,彻底解除对 Batch Size 大小的依赖。
-
【AI 工业核题 B3】BatchNorm1d(批归一化与训练/推理行为差异)(BatchNorm1d with Train vs Eval Distinction)深度实现与原理解析
面试官深度必问考点:训练期用当前 Batch 统计并以动量更新全局均值方差,推理期冻结并采用全局统计量。
-
【AI 工业核题 B2】RMSNorm(均方根归一化)(Root Mean Square Normalization (RMSNorm))深度实现与原理解析
抛弃均值偏移计算,仅通过均方根进行缩放,加速 10%~50% 的现代化 LLM 归一化方案。
-
【AI 工业核题 B1】LayerNorm(层归一化与仿射变换)(Layer Normalization with Affine Transformation)深度实现与原理解析
跨特征维度归一化,训练与推理行为完全一致,包含可学习参数 gamma 和 beta。
-
【AI 工业核题 A5】Softplus 与 LeakyReLU(数值防溢出分段)(Softplus & LeakyReLU with Overflow Guards)深度实现与原理解析
Softplus 的阈值截断防溢出实现,以及 LeakyReLU 负斜率泄漏机制。
-
【AI 工业核题 A4】SwiGLU 门控前馈算子(LLaMA / DeepSeek 核心)(SwiGLU Gated Feed-Forward Network)深度实现与原理解析
现代大模型最核心的 FFN 算子,由 Gate/Up 投影与 SiLU 逐元素相乘并 Down 投影降维。
-
【AI 工业核题 A3】GELU 激活函数(Tanh 近似与精确式)(Gaussian Error Linear Unit (GELU))深度实现与原理解析
基于高斯累积分布的自适应随机正则化门控激活,现代 GPT/BERT 标配算子。
-
【AI 工业核题 A2】Sigmoid 与 Log-Sigmoid(数值稳定)(Numerically Stable Sigmoid & Log-Sigmoid)深度实现与原理解析
正负区间分段避免大负数指数溢出,Log-Sigmoid 采用 logaddexp 解决二元损失下溢。