Tag: long-context-extensions-scaling
-
【AI 核心深度 M4-067】解释长上下文的主要挑战。(Core Challenges of Scaling to Long Context Windows)深度数理推导与工程落地解析
注意力 O(L²) 计算与 KV cache O(L) 显存、位置编码外推、训练数据稀缺、以及’有效利用’(lost in the middle)四类挑战。
-
【AI 核心深度 M4-068】解释’迷失在中间’(lost in the middle)现象。(The ‘Lost in the Middle’ Phenomenon in Long Context Models)深度数理推导与工程落地解析
模型对长上下文开头与结尾的信息检索能力强,中间位置显著弱;因注意力汇聚在开头、局部窗口在结尾。
-
【AI 核心深度 M4-069】比较长上下文的扩展路线:外推、检索增强、结构改造。(Long Context Scaling Strategies: Length Extrapolation, RAG, and Architectural Redesign)深度数理推导与工程落地解析
外推(位置编码 + 少量微调)最省成本;检索增强(RAG)最经济;结构改造(稀疏/线性/SSM)最根本但需重训。
-
【AI 核心深度 M4-070】解释滑动窗口注意力 + 全局 token 的混合设计。(Hybrid Design of Sliding Window Attention and Global Tokens)深度数理推导与工程落地解析
大部分层用滑窗(局部)省算力,少量全局 token 或全注意力层保证信息能跨长距离流动。
-
【AI 核心深度 M4-071】解释长上下文训练中的数据构造与课程学习。(Data Construction and Curriculum Learning for Long-Context Training)深度数理推导与工程落地解析
长文档稀缺,常用’短文档拼接’或’合成任务(NIAH 风格)’构造数据;用长度课程学习(逐步加长)稳定训练。
-
【AI 核心深度 M4-072】解释上下文长度与推理成本的关系,以及经济性权衡。(Context Length vs. Inference Cost and Economic Trade-offs)深度数理推导与工程落地解析
注意力成本 ∝L²(prefill)、KV 显存 ∝L;故长上下文的成本远高于’检索 + 短上下文’。
-
【AI 核心深度 M4-073】解释长上下文的注意力模式经验规律(sink + 局部窗口)。(Empirical Attention Patterns in Long Contexts: Attention Sinks and Local Windows)深度数理推导与工程落地解析
长上下文模型的注意力呈’双峰’:大量权重给序列开头的 sink、其余集中在局部窗口,中间位置权重低。