Tag: vision-encoders-vit-convnext
-
【AI 核心深度 M6-001】解释 ViT 的 patch embedding 与 token 数计算。(ViT Patch Embedding Formulation and Token Count Calculation)深度数理推导与工程落地解析
把图像切成 P×P 的 patch,线性投影为 token;token 数 = (H/P)×(W/P),故随分辨率平方增长。
-
【AI 核心深度 M6-002】比较 CNN 与 ViT 的归纳偏置与数据需求。(Inductive Biases and Data Efficiency: CNN vs. Vision Transformer)深度数理推导与工程落地解析
CNN 有局部性/平移等变先验(样本效率高);ViT 偏置弱(需大数据),但数据充足时上限更高。
-
【AI 核心深度 M6-003】解释 Swin Transformer 的窗口注意力与层级设计。(Shifted Window Attention and Hierarchical Architecture in Swin Transformer)深度数理推导与工程落地解析
局部窗口内做注意力(O(N)),相邻层用移动窗口实现跨窗口通信,并用 patch merging 做层级下采样。
-
【AI 核心深度 M6-004】解释自监督视觉预训练的主要范式。(Self-Supervised Visual Pre-training Paradigms: Contrastive vs. Masked Image Modeling)深度数理推导与工程落地解析
对比式(SimCLR/MoCo/CLIP)、掩码重建式(MAE/BEiT)、自蒸馏式(DINO/DINOv2)、以及多模态对齐式。
-
【AI 核心深度 M6-005】解释视觉编码器的输出如何与语言模型对齐。(Aligning Vision Encoder Representations with Language Model Embedding Spaces)深度数理推导与工程落地解析
视觉塔输出 patch token,经连接器投影到 LLM 的词嵌入空间,作为’视觉 token’与文本拼接送入 LLM。
-
【AI 核心深度 M6-006】解释视觉 token 数量对成本的影响。(Computational Cost Scaling of Visual Token Counts in Multimodal Transformers)深度数理推导与工程落地解析
视觉 token 数 ∝ 分辨率²/patch²;它同时占用 LLM 的注意力成本(O(L²))与上下文预算,是 VLM 成本主因。
-
【AI 核心深度 M6-007】解释视觉编码器的选择(CLIP-ViT / SigLIP / DINOv2)与各自特点。(Vision Encoder Selection: CLIP-ViT vs. SigLIP vs. DINOv2 Comparative Trade-offs)深度数理推导与工程落地解析
CLIP-ViT 语言对齐、生态成熟;SigLIP 用 sigmoid 损失更高效、质量更好;DINOv2 纯视觉语义强、适合密集任务。