AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M3-019】GELU 与 SiLU 的区别与联系?各自被哪些模型采用?(GELU vs SiLU: Differences, Connections, and Industry Model Adoption)深度数理推导与工程落地解析
两者都是平滑非单调激活;GELU 用高斯 CDF 门控、SiLU 用 sigmoid 门控;BERT/GPT-2 用 GELU,LLaMA/PaLM 用 SiLU(SwiGLU)。
【AI 核心深度 M3-020】比较 BatchNorm 与 LayerNorm 的归一化维度与适用场景(Comparing BatchNorm and LayerNorm: Normalization Dimensions and Applicable Regimes)深度数理推导与工程落地解析
BN 跨 batch 归一化(依赖 batch,CNN 常用);LN 跨特征归一化(与 batch 无关,Transformer/RNN 常用)。
【AI 核心深度 M3-021】解释 RMSNorm 与 LayerNorm 的差异,为什么 LLaMA 用 RMSNorm(RMSNorm vs LayerNorm: Mathematical Differences and Why LLaMA Adopted RMSNorm)深度数理推导与工程落地解析
RMSNorm 不减均值、无偏置,只按均方根缩放;更省算力且效果相当。
【AI 核心深度 M2-112】解释目标编码的交叉拟合实现细节与平滑公式(Target Encoding Implementation Details: Out-of-Fold Cross-Fitting and Smoothing)深度数理推导与工程落地解析
K 折内用其他折的标签均值编码本折;平滑向全局均值收缩,尤其保护低频类别。
【AI 核心深度 M2-113】比较文本特征的 TF-IDF 与嵌入表示,以及它们的取舍(Text Features: Comparing TF-IDF and Dense Embedding Representations)深度数理推导与工程落地解析
TF-IDF 稀疏可解释、无需训练;嵌入稠密语义强、需预训练且维度低。
【AI 核心深度 M2-114】解释 EasyEnsemble 与 BalanceCascade 等不平衡集成方法(Imbalanced Ensembling: EasyEnsemble and BalanceCascade Explained)深度数理推导与工程落地解析
用多个欠采样子集训练多个模型后集成;避免欠采样丢信息,也避免过采样过拟合。
【AI 核心深度 M2-115】解释不平衡场景下的监控与上线后评估要点(Post-Deployment Monitoring and Evaluation Under Severe Class Imbalance)深度数理推导与工程落地解析
监控正类比例漂移、分群性能、校准质量与业务指标;不平衡使离线指标易失真。
【AI 核心深度 M2-116】解释 MICE(多重插补链式方程)的迭代过程与实现要点(MICE (Multiple Imputation by Chained Equations): Iterative Process and Key Details)深度数理推导与工程落地解析
对每个缺失特征用其他特征回归预测,循环迭代;每次抽取多个候选值生成 M 个完整数据集。
【AI 核心深度 M2-117】解释时间序列与面板数据中的泄漏防范要点(Preventing Data Leakage in Time Series and Panel Data: Critical Safeguards)深度数理推导与工程落地解析
严格时间切分、滚动特征右开区间、按实体分组、避免全量统计量;泄漏最隐蔽也最致命。
【AI 核心深度 M2-118】解释多指标权衡与综合指标(OEC)的设计(Multi-Metric Trade-offs and Designing an Overall Evaluation Criterion (OEC))深度数理推导与工程落地解析
单一综合指标(OEC)便于决策但会掩盖局部;需配合护栏指标与分层分析。
【AI 核心深度 M2-119】解释超参调优的自动化工具与实践流程(Automated Hyperparameter Optimization Tools and Industrial Best-Practice Workflows)深度数理推导与工程落地解析
Optuna/Ray Tune 提供 TPE、Hyperband、ASHA 等算法;流程是分阶段(粗筛→精调)并按重要度排序。
【AI 核心深度 M3-001】解释计算图与自动微分的两种模式(前向/反向)(Computational Graphs and Two Automatic Differentiation Modes: Forward vs Reverse)深度数理推导与工程落地解析
前向模式算 JVP(输入维大时贵);反向模式算 VJP(输出维小时优,如标量损失)。
【AI 核心深度 M3-002】反向传播需要保存哪些中间量?如何省显存(Intermediate Quantities Retained for Backpropagation and Memory Optimization)深度数理推导与工程落地解析
需保存激活值与局部梯度;可用梯度检查点、混合精度、分片(FSDP)降低显存。
【AI 核心深度 M3-003】解释梯度累加(gradient accumulation),它等价于什么(Gradient Accumulation: Mathematical Equivalence and Implementation)深度数理推导与工程落地解析
多步前向反向累加梯度后再更新;等价于更大 batch,但 BN 统计仍按 micro-batch 计算。
【AI 核心深度 M3-004】什么是 in-place 操作对反向传播的风险?(Risks of In-Place Tensor Operations in Backpropagation)深度数理推导与工程落地解析
原地修改会覆盖反向所需的中间值,导致梯度错误或报错;框架用版本计数检测。