Tag: positional-embeddings-sinusoidal-rope-al
-
【AI 核心深度 M4-025】解释正弦位置编码为什么能外推到更长序列(Sinusoidal Positional Encoding: Mathematical Mechanics and Theoretical Length Extrapolation)深度数理推导与工程落地解析
用不同频率的正弦/余弦对编码位置,任意位置都有定义且相对位移可表示为线性变换,故理论上可外推。
-
【AI 核心深度 M4-026】解释 RoPE 的旋转机制与相对位置性质(Rotary Position Embedding (RoPE): Mathematical Mechanics and Relative Distance Invariance)深度数理推导与工程落地解析
把 Q/K 按二维子空间旋转角度 ∝ 位置,使 QKᵀ 只依赖相对位置差;无需加性编码、可自然衰减远距离注意力。
-
【AI 核心深度 M4-027】比较绝对位置编码、相对位置编码与 RoPE/ALiBi(Comparing Positional Encodings: Absolute vs Relative vs RoPE vs ALiBi)深度数理推导与工程落地解析
绝对编码加到输入、位置固定;相对编码建模位置差;RoPE 用旋转实现相对位置;ALiBi 用线性衰减偏置,外推性最好。
-
【AI 核心深度 M4-028】解释 NTK-aware 与 YaRN 的 RoPE 外推原理(Context Length Extension in RoPE: Position Interpolation, NTK-Aware Scaling, and YaRN)深度数理推导与工程落地解析
NTK-aware 按’插值低频、保留高频’非均匀缩放位置;YaRN 在 NTK 基础上加温度校正与注意力缩放,外推更稳。
-
【AI 核心深度 M4-029】解释位置插值(PI)与它的代价(Position Interpolation (PI) for RoPE Extension and Its Trade-offs)深度数理推导与工程落地解析
把位置线性压缩 s 倍使超出训练长度的位置落入训练范围;代价是局部位置分辨力下降与注意力熵增大。
-
【AI 核心深度 M4-030】为什么去掉位置编码模型仍能获得部分位置信息?(Why Models Can Infer Position Without Explicit Positional Encodings (NoPE))深度数理推导与工程落地解析
因果 mask 使位置信息可从’可看多少上下文’中隐式推断;此外 token 频率/局部模式也携带位置线索。
-
【AI 核心深度 M4-031】解释 RoPE 的实现细节(复数形式、高效计算、基频 θ)(RoPE Implementation Details: Complex Formulation, Fast Kernel Tricks, and Base Frequencies)深度数理推导与工程落地解析
RoPE 可写成复数乘法(q·e^{ipθ});实现用预计算 sin/cos 做逐元素乘加;基频 θ 决定可区分的最大距离。
-
【AI 核心深度 M4-032】解释 ALiBi 的线性偏置与它的外推性(ALiBi (Attention with Linear Biases): Mechanisms and Zero-Shot Length Extrapolation)深度数理推导与工程落地解析
不加位置编码,直接在注意力 logits 上加 −m_h·(i−j) 的线性衰减;不同头用不同斜率,外推性极强且零参数。
-
【AI 核心深度 M4-033】解释 2D/3D RoPE(多模态与视频中的位置编码)(2D and 3D Rotary Position Embeddings (RoPE) for Vision and Video Multimodal Models)深度数理推导与工程落地解析
把 RoPE 的维度分成若干段,分别编码时间/高度/宽度等维度;M-RoPE 用这种方式统一处理文本与图像。
-
【AI 核心深度 M4-034】解释位置编码与长度外推的评测方法(Benchmarking Positional Encodings and Context Length Extrapolation)深度数理推导与工程落地解析
用 PPL 随长度曲线、needle-in-a-haystack、长文档 QA、RULER 等综合基准;单看 PPL 会高估外推能力。