Tag: activation-functions
-
【AI 核心深度 M3-013】比较 Sigmoid、Tanh、ReLU 的优缺点(Comparing Sigmoid, Tanh, and ReLU: Mathematical Properties and Trade-offs)深度数理推导与工程落地解析
Sigmoid/Tanh 饱和导致梯度消失且非零中心;ReLU 不饱和、计算快,但有死亡问题。
-
【AI 核心深度 M3-015】为什么 Transformer 用 GELU/SiLU 而不是 ReLU?(Why Modern Transformers Use GELU and SiLU Instead of ReLU)深度数理推导与工程落地解析
平滑激活在 0 附近可导、梯度更稳定,且实验上语言建模效果更好。
-
【AI 核心深度 M3-016】什么是门控线性单元(GLU)家族?为什么它们有效(The Gated Linear Unit (GLU) Family and Why They Excel in Large Language Models)深度数理推导与工程落地解析
用一路输入作为’门’乘另一路,实现输入依赖的非线性调制;表达力强于单路激活。
-
【AI 核心深度 M3-017】激活函数的选择如何影响数值稳定性与训练速度?(How Activation Function Choice Impacts Numerical Stability and Training Speed)深度数理推导与工程落地解析
饱和函数数值不稳(梯度消失 + exp 溢出);分段/平滑函数更快;注意 FP16 下的溢出区间。
-
【AI 核心深度 M3-018】激活函数的平滑性如何影响量化(INT8/INT4)推理的精度?(How Activation Smoothness Impacts INT8/INT4 Quantization Accuracy)深度数理推导与工程落地解析
ReLU 有精确零点、分段线性,量化友好;GELU/SiLU 平滑且分布连续,量化误差更大,需逐 token 动态量化或保留高精度。
-
【AI 核心深度 M3-019】GELU 与 SiLU 的区别与联系?各自被哪些模型采用?(GELU vs SiLU: Differences, Connections, and Industry Model Adoption)深度数理推导与工程落地解析
两者都是平滑非单调激活;GELU 用高斯 CDF 门控、SiLU 用 sigmoid 门控;BERT/GPT-2 用 GELU,LLaMA/PaLM 用 SiLU(SwiGLU)。