AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M4-067】解释长上下文的主要挑战。(Core Challenges of Scaling to Long Context Windows)深度数理推导与工程落地解析
注意力 O(L²) 计算与 KV cache O(L) 显存、位置编码外推、训练数据稀缺、以及’有效利用’(lost in the middle)四类挑战。
【AI 核心深度 M4-068】解释’迷失在中间’(lost in the middle)现象。(The ‘Lost in the Middle’ Phenomenon in Long Context Models)深度数理推导与工程落地解析
模型对长上下文开头与结尾的信息检索能力强,中间位置显著弱;因注意力汇聚在开头、局部窗口在结尾。
【AI 核心深度 M4-069】比较长上下文的扩展路线:外推、检索增强、结构改造。(Long Context Scaling Strategies: Length Extrapolation, RAG, and Architectural Redesign)深度数理推导与工程落地解析
外推(位置编码 + 少量微调)最省成本;检索增强(RAG)最经济;结构改造(稀疏/线性/SSM)最根本但需重训。
【AI 核心深度 M4-070】解释滑动窗口注意力 + 全局 token 的混合设计。(Hybrid Design of Sliding Window Attention and Global Tokens)深度数理推导与工程落地解析
大部分层用滑窗(局部)省算力,少量全局 token 或全注意力层保证信息能跨长距离流动。
【AI 核心深度 M4-071】解释长上下文训练中的数据构造与课程学习。(Data Construction and Curriculum Learning for Long-Context Training)深度数理推导与工程落地解析
长文档稀缺,常用’短文档拼接’或’合成任务(NIAH 风格)’构造数据;用长度课程学习(逐步加长)稳定训练。
【AI 核心深度 M4-072】解释上下文长度与推理成本的关系,以及经济性权衡。(Context Length vs. Inference Cost and Economic Trade-offs)深度数理推导与工程落地解析
注意力成本 ∝L²(prefill)、KV 显存 ∝L;故长上下文的成本远高于’检索 + 短上下文’。
【AI 核心深度 M4-073】解释长上下文的注意力模式经验规律(sink + 局部窗口)。(Empirical Attention Patterns in Long Contexts: Attention Sinks and Local Windows)深度数理推导与工程落地解析
长上下文模型的注意力呈’双峰’:大量权重给序列开头的 sink、其余集中在局部窗口,中间位置权重低。
【AI 核心深度 M4-074】解释 MoE 的基本结构与稀疏激活。(Mixture of Experts (MoE) Architecture and Sparse Activation)深度数理推导与工程落地解析
把 FFN 换成 N 个专家,路由器为每个 token 选 Top-k 个专家计算;总参数大但每 token 激活量小。
【AI 核心深度 M4-075】解释 MoE 的负载均衡损失,为什么需要它。(Load Balancing Loss in MoE and Why Routing Collapse Occurs)深度数理推导与工程落地解析
路由器倾向只选少数专家(赢者通吃),导致专家利用不均、训练不稳;用辅助损失鼓励均匀分配。
【AI 核心深度 M4-076】解释 MoE 的通信挑战与专家并行。(Communication Bottlenecks and Expert Parallelism in MoE)深度数理推导与工程落地解析
专家分在不同设备上,token 需 all-to-all 发送到对应专家再取回;通信量与路由不均衡是主要开销。
【AI 核心深度 M4-077】比较稠密模型与 MoE 的推理特性。(Inference Characteristics: Dense Models vs. MoE)深度数理推导与工程落地解析
同激活参数下 MoE 质量更好但显存需求 ∝ 总参数、计算不规则;稠密模型显存小、计算规则、吞吐更优。
【AI 核心深度 M4-053】解释 IO 复杂度分析与 roofline 模型(IO Complexity Analysis and the GPU Roofline Performance Model)深度数理推导与工程落地解析
用’访问字节数’衡量算法成本;roofline 用算术强度(FLOPs/字节)判断算力受限还是带宽受限。
【AI 核心深度 M4-054】解释 FlashAttention-2/3 的改进(Architectural Innovations in FlashAttention-2 and FlashAttention-3)深度数理推导与工程落地解析
FA2 优化并行度与 warp 调度、减少非 matmul FLOPs;FA3 面向 Hopper 用 TMA 与 warp specialization。
【AI 核心深度 M4-055】解释 decode 阶段的注意力瓶颈与 Flash-Decoding(Decoding Phase Attention Bottlenecks and the Flash-Decoding Solution)深度数理推导与工程落地解析
decode 每步只算 1 个 query,但需读取全部 KV cache;并行度不足导致 GPU 空闲,Flash-Decoding 用’切分 KV + 两阶段归约’提升并行。
【AI 核心深度 M4-056】解释算子融合与 torch.compile 对注意力的收益(Operator Fusion and torch.compile Speedups in Modern Attention Architectures)深度数理推导与工程落地解析
把多个小算子合并为一个 kernel,减少中间张量的 HBM 往返与 kernel 启动开销;compile 可自动融合并生成高效代码。