Tag: dynamic-resolution-visual-tokens
-
【AI 核心深度 M6-029】解释视觉 token 压缩的常见方法。(Visual Token Compression Paradigms: Spatial Pooling, Attention Pruning, and Cross-Attention Bottlenecks)深度数理推导与工程落地解析
池化(相邻 patch 合并)、查询压缩(Q-Former/Resampler)、注意力池化、以及学习式剪枝;代价是细节损失。
-
【AI 核心深度 M6-030】解释视觉 token 与文本 token 的预算分配问题。(Context Budget Allocation and Information Density Balancing Between Vision and Text Tokens)深度数理推导与工程落地解析
总长度受上下文限制;视觉 token 多则文本少;需按任务分配(文档多给视觉、对话多给文本)并压缩。
-
【AI 核心深度 M6-031】解释动态分辨率对 OCR 与文档理解的影响。(Impact of Dynamic High Resolution on Optical Character Recognition and Document Understanding)深度数理推导与工程落地解析
OCR 需要高分辨率(小字),动态分辨率使小字可辨;但 token 成本高,需配合压缩与分块。
-
【AI 核心深度 M6-025】解释动态分辨率(native resolution)的原理与动机。(Dynamic Native Resolution Foundations, Motivation, and Aspect Ratio Preservation)深度数理推导与工程落地解析
不做固定尺寸缩放,按图像原生分辨率切分 patch,使 token 数与图像内容/尺寸匹配,保住细节。
-
【AI 核心深度 M6-026】解释 2D RoPE 在视觉中的必要性。(Mathematical Formulations and Geometric Necessity of 2D Rotary Position Embeddings (2D RoPE))深度数理推导与工程落地解析
图像 patch 有 (row, col) 两个坐标;1D 展平会破坏二维邻接,故需按维度分段旋转的 2D/多维 RoPE。
-
【AI 核心深度 M6-027】解释图像切分(tiling / AnyRes)策略与取舍。(Image Tiling and AnyRes Multi-Crop Strategies: Grid Partitioning and Global Context Trade-offs)深度数理推导与工程落地解析
把高分辨率图切成多个固定尺寸的 tile(各自编码)+ 一个全局缩略图,兼顾细节与全局;代价是 tile 数与 token 数增长。
-
【AI 核心深度 M6-028】解释图像预处理插值方法对下游的影响。(Impact of Image Preprocessing Interpolation Algorithms on Downstream Multimodal Perception)深度数理推导与工程落地解析
resize 的插值(bilinear/bicubic/antialias)影响细节保真;抗锯齿插值可显著改善鲁棒性与细粒度任务。