Tag: module-m4
-
【AI 核心深度 M4-068】解释’迷失在中间’(lost in the middle)现象。(The ‘Lost in the Middle’ Phenomenon in Long Context Models)深度数理推导与工程落地解析
模型对长上下文开头与结尾的信息检索能力强,中间位置显著弱;因注意力汇聚在开头、局部窗口在结尾。
-
【AI 核心深度 M4-069】比较长上下文的扩展路线:外推、检索增强、结构改造。(Long Context Scaling Strategies: Length Extrapolation, RAG, and Architectural Redesign)深度数理推导与工程落地解析
外推(位置编码 + 少量微调)最省成本;检索增强(RAG)最经济;结构改造(稀疏/线性/SSM)最根本但需重训。
-
【AI 核心深度 M4-070】解释滑动窗口注意力 + 全局 token 的混合设计。(Hybrid Design of Sliding Window Attention and Global Tokens)深度数理推导与工程落地解析
大部分层用滑窗(局部)省算力,少量全局 token 或全注意力层保证信息能跨长距离流动。
-
【AI 核心深度 M4-071】解释长上下文训练中的数据构造与课程学习。(Data Construction and Curriculum Learning for Long-Context Training)深度数理推导与工程落地解析
长文档稀缺,常用’短文档拼接’或’合成任务(NIAH 风格)’构造数据;用长度课程学习(逐步加长)稳定训练。
-
【AI 核心深度 M4-072】解释上下文长度与推理成本的关系,以及经济性权衡。(Context Length vs. Inference Cost and Economic Trade-offs)深度数理推导与工程落地解析
注意力成本 ∝L²(prefill)、KV 显存 ∝L;故长上下文的成本远高于’检索 + 短上下文’。
-
【AI 核心深度 M4-073】解释长上下文的注意力模式经验规律(sink + 局部窗口)。(Empirical Attention Patterns in Long Contexts: Attention Sinks and Local Windows)深度数理推导与工程落地解析
长上下文模型的注意力呈’双峰’:大量权重给序列开头的 sink、其余集中在局部窗口,中间位置权重低。
-
【AI 核心深度 M4-074】解释 MoE 的基本结构与稀疏激活。(Mixture of Experts (MoE) Architecture and Sparse Activation)深度数理推导与工程落地解析
把 FFN 换成 N 个专家,路由器为每个 token 选 Top-k 个专家计算;总参数大但每 token 激活量小。
-
【AI 核心深度 M4-075】解释 MoE 的负载均衡损失,为什么需要它。(Load Balancing Loss in MoE and Why Routing Collapse Occurs)深度数理推导与工程落地解析
路由器倾向只选少数专家(赢者通吃),导致专家利用不均、训练不稳;用辅助损失鼓励均匀分配。
-
【AI 核心深度 M4-076】解释 MoE 的通信挑战与专家并行。(Communication Bottlenecks and Expert Parallelism in MoE)深度数理推导与工程落地解析
专家分在不同设备上,token 需 all-to-all 发送到对应专家再取回;通信量与路由不均衡是主要开销。
-
【AI 核心深度 M4-077】比较稠密模型与 MoE 的推理特性。(Inference Characteristics: Dense Models vs. MoE)深度数理推导与工程落地解析
同激活参数下 MoE 质量更好但显存需求 ∝ 总参数、计算不规则;稠密模型显存小、计算规则、吞吐更优。