Tag: talentme
-
【AI 工业核题 B2】RMSNorm(均方根归一化)(Root Mean Square Normalization (RMSNorm))深度实现与原理解析
抛弃均值偏移计算,仅通过均方根进行缩放,加速 10%~50% 的现代化 LLM 归一化方案。
-
【AI 工业核题 B1】LayerNorm(层归一化与仿射变换)(Layer Normalization with Affine Transformation)深度实现与原理解析
跨特征维度归一化,训练与推理行为完全一致,包含可学习参数 gamma 和 beta。
-
【AI 工业核题 A5】Softplus 与 LeakyReLU(数值防溢出分段)(Softplus & LeakyReLU with Overflow Guards)深度实现与原理解析
Softplus 的阈值截断防溢出实现,以及 LeakyReLU 负斜率泄漏机制。
-
【AI 工业核题 A4】SwiGLU 门控前馈算子(LLaMA / DeepSeek 核心)(SwiGLU Gated Feed-Forward Network)深度实现与原理解析
现代大模型最核心的 FFN 算子,由 Gate/Up 投影与 SiLU 逐元素相乘并 Down 投影降维。
-
【AI 工业核题 A3】GELU 激活函数(Tanh 近似与精确式)(Gaussian Error Linear Unit (GELU))深度实现与原理解析
基于高斯累积分布的自适应随机正则化门控激活,现代 GPT/BERT 标配算子。
-
【AI 工业核题 A2】Sigmoid 与 Log-Sigmoid(数值稳定)(Numerically Stable Sigmoid & Log-Sigmoid)深度实现与原理解析
正负区间分段避免大负数指数溢出,Log-Sigmoid 采用 logaddexp 解决二元损失下溢。
-
-
AI Weekly: OpenAI Preps $500/mo ChatGPT Pro Max & Releases GPT-6 Sol/Luna, Anthropic Strikes $11.6B Akamai Deal & Opus 5.5, Google Tests Orbital Datacenter TPUs, DeepSeek Hits $1B ARR
This week delivered monumental breakthroughs across tiered enterprise monetization, cosmic-scale infrastructure, and machine-native decision intelligence: OpenAI leaked an upcoming
-
AI 周报:OpenAI 拟推 $500/月 ChatGPT Pro Max 且 GPT-6 双星齐发,Anthropic 祭出 116 亿美元算力大单与 Opus 5.5,Google 试水轨道数据中心,DeepSeek 商业化 ARR 破 10 亿刀
本周全球 AI 在分层商业化、算力极限基建与机器原生决策架构上迎来里程碑式突破:OpenAI 在 DevDay 前夕泄露定价高达 $500/月的 ChatGPT Pro Max 旗舰订阅计划,并低调上线 GPT-6 Sol 与 GPT-6 Luna 双轻量变体;Anthropic 豪掷 116 亿美元锁定 Akamai 7年 CPU 算力集群,同步发布推理成
-
AI Weekly: Claude Drives 26% of Internal R&D and Launches Projects v2, Noam Brown Details Recursive Self-Improvement, Figure Helix 2.5 Enters Real Homes, Qwen3.8-Omni and 1.76-bit Bonsai Debut
This week marks a historic turning point from prompt invocation to recursive self-improvement and autonomous scientific discovery loops: Anthropic revealed that Claude now directly