AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 工业核题 F5】GAE(广义优势估计)(Generalized Advantage Estimation (GAE))深度实现与原理解析
通过指数加权移动平均在单步 TD 误差(低方差高偏差)与全蒙特卡洛回报(零偏差高方差)之间达成最优权衡。
【AI 工业核题 F4】GRPO 组内相对优势归一化(DeepSeek 核心免 Critic 架构)(Group Relative Policy Optimization (GRPO))深度实现与原理解析
DeepSeekMath / DeepSeek-R1 核心基石,彻底砍掉同等规模的 Critic 价值网络,组内自归一化节省 50% 显存。
【AI 工业核题 F3】PPO 裁剪代理目标损失(Clipped Surrogate Objective)(PPO Clipped Surrogate Objective Loss)深度实现与原理解析
OpenAI 强化学习基石,通过重要性采样概率比与 [1-eps, 1+eps] 截断防止策略单步更新步子迈太大崩盘。
【AI 工业核题 F2】DPO 直接偏好优化损失(免奖励模型对齐)(Direct Preference Optimization (DPO))深度实现与原理解析
斯坦福团队里程碑,彻底抛弃独立 Reward Model 与 PPO 采样,显式解析求解直接在策略网络上微调偏好。
【AI 工业核题 F1】Bradley-Terry 奖励模型损失(偏好对数似然)(Bradley-Terry Preference Reward Model Loss)深度实现与原理解析
InstructGPT / RLHF 奖励模型的核心训练目标,Chosen 胜过 Rejected 标量分差的 Sigmoid 交叉熵。
【AI 工业核题 E8】Huber Loss / Smooth L1(对异常点鲁棒的回归损失)(Huber Loss & Smooth L1 Loss)深度实现与原理解析
误差较小时采用 L2 平滑二次收敛,误差较大时切换为 L1 线性常数梯度,目标检测边界框回归标配。
【AI 工业核题 E7】Perplexity (PPL) 困惑度计算(Perplexity (PPL) Calculation)深度实现与原理解析
语言模型最核心的端到端评测指标,平均交叉熵损失的自然对数指数映射。
【AI 工业核题 E6】Triplet Margin Loss(三元组边际损失)(Triplet Margin Loss with Euclidean Distance)深度实现与原理解析
人脸识别与度量学习经典,拉近 Anchor 与 Positive 距离,推远 Negative 距离并保持 Margin。
【AI 工业核题 E5】CLIP 对称对比损失(双向图文匹配)(CLIP Symmetric Contrastive Loss)深度实现与原理解析
OpenAI CLIP 多模态对齐灵魂,图像搜文本与文本搜图像双向交叉熵求和平均。
【AI 工业核题 E4】InfoNCE 对比学习损失(Batch 内样本对与温度缩放)(InfoNCE Contrastive Loss)深度实现与原理解析
SimCLR / MoCo / 对比表示学习核心,互信息下界优化,同行对角线为正样本,其余为负样本。
【AI 工业核题 E3】Focal Loss(类别不平衡聚焦因子)(Focal Loss for Dense Object Detection)深度实现与原理解析
何恺明团队解决单阶段检测器正负样本极度失衡的杰作,通过调制因子 (1-pt)^gamma 抑制海量简单负样本。
【AI 工业核题 E2】BCE with Logits Loss(二元交叉熵数值稳定)(Binary Cross-Entropy with Logits)深度实现与原理解析
融合 Sigmoid 与 Log 损失,通过 max(x, 0) – x*y + log1p(exp(-|x|)) 消除上下溢溢出风险。
【AI 工业核题 E1】Cross-Entropy 交叉熵(Log-Softmax 稳定 + ignore_index)(Cross-Entropy Loss with Log-Softmax & ignore_index)深度实现与原理解析
通过 Log-Sum-Exp 稳定化消除中间概率下溢,支持忽略填充标签 ignore_index 的工业级损失算子。
【AI 工业核题 D6】FlashAttention Online Softmax 概念手撕(分块增量归一化)(FlashAttention Online Softmax Block-wise Algorithm)深度实现与原理解析
Tri Dao 经典突破,SRAM 分块平铺计算与指数动量增量合并,避免向 HBM 回写 N×N 注意力矩阵。
【AI 工业核题 D5】Cross-Attention 跨模态/跨序列注意力(Cross-Attention Mechanism)深度实现与原理解析
Query 来自解码器/当前序列,Key 与 Value 来自编码器/跨模态提示条件,文本生成与 Diffusion 条件注入基石。