Tag: applied-scientist
-
【AI 核心深度 M6-023】解释多图与交错输入(interleaved)的处理。(Multi-Image and Interleaved Image-Text Processing in Multimodal LLMs)深度数理推导与工程落地解析
多图:把多张图的视觉 token 拼接(用分隔符标记);交错:按原文顺序插入图文 token,需位置编码与注意力设计支持。
-
【AI 核心深度 M6-024】解释 VLM 中视觉 token 的放置位置(前置 / 后置 / 交错)与影响。(Visual Token Placement Strategies: Prefix vs Suffix vs Interleaved Positional Dynamics)深度数理推导与工程落地解析
视觉 token 通常放在文本前(前置)或按需插入(交错);位置影响注意力可见性与衰减,且训练推理必须一致。
-
【AI 核心深度 M6-025】解释动态分辨率(native resolution)的原理与动机。(Dynamic Native Resolution Foundations, Motivation, and Aspect Ratio Preservation)深度数理推导与工程落地解析
不做固定尺寸缩放,按图像原生分辨率切分 patch,使 token 数与图像内容/尺寸匹配,保住细节。
-
【AI 核心深度 M6-026】解释 2D RoPE 在视觉中的必要性。(Mathematical Formulations and Geometric Necessity of 2D Rotary Position Embeddings (2D RoPE))深度数理推导与工程落地解析
图像 patch 有 (row, col) 两个坐标;1D 展平会破坏二维邻接,故需按维度分段旋转的 2D/多维 RoPE。
-
【AI 核心深度 M6-027】解释图像切分(tiling / AnyRes)策略与取舍。(Image Tiling and AnyRes Multi-Crop Strategies: Grid Partitioning and Global Context Trade-offs)深度数理推导与工程落地解析
把高分辨率图切成多个固定尺寸的 tile(各自编码)+ 一个全局缩略图,兼顾细节与全局;代价是 tile 数与 token 数增长。
-
【AI 核心深度 M6-028】解释图像预处理插值方法对下游的影响。(Impact of Image Preprocessing Interpolation Algorithms on Downstream Multimodal Perception)深度数理推导与工程落地解析
resize 的插值(bilinear/bicubic/antialias)影响细节保真;抗锯齿插值可显著改善鲁棒性与细粒度任务。
-
【AI 核心深度 M6-001】解释 ViT 的 patch embedding 与 token 数计算。(ViT Patch Embedding Formulation and Token Count Calculation)深度数理推导与工程落地解析
把图像切成 P×P 的 patch,线性投影为 token;token 数 = (H/P)×(W/P),故随分辨率平方增长。
-
【AI 核心深度 M6-002】比较 CNN 与 ViT 的归纳偏置与数据需求。(Inductive Biases and Data Efficiency: CNN vs. Vision Transformer)深度数理推导与工程落地解析
CNN 有局部性/平移等变先验(样本效率高);ViT 偏置弱(需大数据),但数据充足时上限更高。
-
【AI 核心深度 M6-003】解释 Swin Transformer 的窗口注意力与层级设计。(Shifted Window Attention and Hierarchical Architecture in Swin Transformer)深度数理推导与工程落地解析
局部窗口内做注意力(O(N)),相邻层用移动窗口实现跨窗口通信,并用 patch merging 做层级下采样。
-
【AI 核心深度 M6-004】解释自监督视觉预训练的主要范式。(Self-Supervised Visual Pre-training Paradigms: Contrastive vs. Masked Image Modeling)深度数理推导与工程落地解析
对比式(SimCLR/MoCo/CLIP)、掩码重建式(MAE/BEiT)、自蒸馏式(DINO/DINOv2)、以及多模态对齐式。