AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M4-094】什么场景仍应选择 RNN/LSTM?(When to Still Choose RNN/LSTM Over Transformers: Low-Latency Edge, Microcontrollers, and Infinite Streaming)深度数理推导与工程落地解析
流式/在线(O(1) 状态、低延迟)、极长序列且状态可压缩、边缘设备(小模型)、以及强顺序依赖的状态机任务。
【AI 核心深度 M4-095】如何为长序列任务选择架构?(Architecture Selection Guide for Long-Sequence Tasks)深度数理推导与工程落地解析
按’是否需要精确检索、序列长度、算力/延迟约束’决策:需检索用注意力(或混合),纯统计用 SSM,超长用稀疏/线性。
【AI 核心深度 M4-096】解释位置敏感任务与位置无关任务对架构的不同要求。(Architectural Requirements for Order-Sensitive vs. Order-Invariant Tasks)深度数理推导与工程落地解析
位置敏感任务(检索、复制、算术)需强位置信息(RoPE/位置编码);位置无关任务(分类、情感)可弱化位置。
【AI 核心深度 M4-097】如何评估长序列模型的真实能力?(Systematic Evaluation of Long-Context Models: Beyond Needle-in-a-Haystack to RULER and Reasoning)深度数理推导与工程落地解析
用多任务基准(RULER:检索/多跳/聚合/QA)+ 不同位置与长度的热力图 + 与’仅局部基线’对比,而非只看 PPL。
【AI 核心深度 M4-098】解释序列模型的长度外推与长度泛化。(Length Extrapolation vs. Length Generalization in Sequence Models)深度数理推导与工程落地解析
外推指超出训练长度的表现;长度泛化指能否处理任意长度(含训练内插)。二者都受位置编码与注意力模式限制。
【AI 核心深度 M4-099】解释知识蒸馏的基本框架与温度的作用。(Knowledge Distillation Framework and the Role of Temperature $T$)深度数理推导与工程落地解析
学生学教师的软标签分布;温度 τ>1 使软标签更平滑、暴露类间相似性,提供比硬标签更丰富的监督。
【AI 核心深度 M4-100】解释剪枝的三种粒度。(Three Granularities of Model Pruning: Unstructured, Semi-Structured 2:4, and Structured)深度数理推导与工程落地解析
非结构化(单个权重,稀疏但硬件难加速)、结构化(整通道/头/层,硬件友好)、半结构化(N:M 稀疏,硬件支持)。
【AI 核心深度 M4-101】解释蒸馏中的 on-policy 与 off-policy 数据差异。(On-Policy vs. Off-Policy Data in Knowledge Distillation for LLMs)深度数理推导与工程落地解析
off-policy 用教师生成的数据(分布是教师的);on-policy 用学生自己生成的数据(分布是学生的),后者缓解分布不匹配。
【AI 核心深度 M4-102】解释推理加速的几条路线与适用条件。(Systematic Categorization of Inference Acceleration Pathways and Trade-offs)深度数理推导与工程落地解析
量化、剪枝/稀疏、蒸馏/小模型、架构优化(注意力)、系统优化(批处理/融合/编译)、投机解码。
【AI 核心深度 M4-103】解释量化感知训练(QAT)与训练后量化(PTQ)的取舍。(Quantization-Aware Training (QAT) vs. Post-Training Quantization (PTQ))深度数理推导与工程落地解析
PTQ 无需重训、成本低但精度损失较大(低比特时);QAT 在训练中模拟量化、精度最好但需重训与标注数据。
【AI 核心深度 M4-104】解释量化的精度损失来源与缓解。(Sources of Quantization Precision Loss and Mitigation Techniques)深度数理推导与工程落地解析
损失来自舍入误差(受动态范围与粒度影响)、离群值撑大范围、以及误差在层间累积;用细粒度/离群值分离/缩放缓解。
【AI 核心深度 M4-105】解释 LoRA / QLoRA 与全量微调的取舍。(Trade-offs Between LoRA, QLoRA, and Full Fine-Tuning)深度数理推导与工程落地解析
LoRA 用低秩增量(A·B)只训少量参数;QLoRA 再叠加 4-bit 基座量化;全量微调上限最高但显存与灾难遗忘风险大。
【AI 核心深度 M4-078】解释 MoE 的微调与部署难点。(Fine-Tuning and Deployment Challenges of MoE Models)深度数理推导与工程落地解析
微调时路由器易漂移/专家过拟合、显存需求大;部署需多卡 EP、计算不规则、延迟不可预测。
【AI 核心深度 M4-079】解释共享专家与细粒度专家的设计(DeepSeek-MoE)。(Shared Experts and Fine-Grained Expert Architecture in DeepSeek-MoE)深度数理推导与工程落地解析
共享专家对所有 token 生效(捕捉通用知识),细粒度专家更多更小(组合更灵活),提升专家专业化与效率。
【AI 核心深度 M4-080】解释 MoE 的路由算法(Top-k / expert choice / soft routing)与取舍。(MoE Routing Algorithms: Top-k, Expert Choice, and Soft Routing)深度数理推导与工程落地解析
token-choice Top-k 最常见(token 选专家);expert-choice 让专家选 token(天然均衡);soft routing 全加权(失去稀疏优势)。