AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M6-023】解释多图与交错输入(interleaved)的处理。(Multi-Image and Interleaved Image-Text Processing in Multimodal LLMs)深度数理推导与工程落地解析
多图:把多张图的视觉 token 拼接(用分隔符标记);交错:按原文顺序插入图文 token,需位置编码与注意力设计支持。
【AI 核心深度 M6-024】解释 VLM 中视觉 token 的放置位置(前置 / 后置 / 交错)与影响。(Visual Token Placement Strategies: Prefix vs Suffix vs Interleaved Positional Dynamics)深度数理推导与工程落地解析
视觉 token 通常放在文本前(前置)或按需插入(交错);位置影响注意力可见性与衰减,且训练推理必须一致。
【AI 核心深度 M6-025】解释动态分辨率(native resolution)的原理与动机。(Dynamic Native Resolution Foundations, Motivation, and Aspect Ratio Preservation)深度数理推导与工程落地解析
不做固定尺寸缩放,按图像原生分辨率切分 patch,使 token 数与图像内容/尺寸匹配,保住细节。
【AI 核心深度 M6-026】解释 2D RoPE 在视觉中的必要性。(Mathematical Formulations and Geometric Necessity of 2D Rotary Position Embeddings (2D RoPE))深度数理推导与工程落地解析
图像 patch 有 (row, col) 两个坐标;1D 展平会破坏二维邻接,故需按维度分段旋转的 2D/多维 RoPE。
【AI 核心深度 M6-027】解释图像切分(tiling / AnyRes)策略与取舍。(Image Tiling and AnyRes Multi-Crop Strategies: Grid Partitioning and Global Context Trade-offs)深度数理推导与工程落地解析
把高分辨率图切成多个固定尺寸的 tile(各自编码)+ 一个全局缩略图,兼顾细节与全局;代价是 tile 数与 token 数增长。
【AI 核心深度 M6-028】解释图像预处理插值方法对下游的影响。(Impact of Image Preprocessing Interpolation Algorithms on Downstream Multimodal Perception)深度数理推导与工程落地解析
resize 的插值(bilinear/bicubic/antialias)影响细节保真;抗锯齿插值可显著改善鲁棒性与细粒度任务。
【AI 核心深度 M6-001】解释 ViT 的 patch embedding 与 token 数计算。(ViT Patch Embedding Formulation and Token Count Calculation)深度数理推导与工程落地解析
把图像切成 P×P 的 patch,线性投影为 token;token 数 = (H/P)×(W/P),故随分辨率平方增长。
【AI 核心深度 M6-002】比较 CNN 与 ViT 的归纳偏置与数据需求。(Inductive Biases and Data Efficiency: CNN vs. Vision Transformer)深度数理推导与工程落地解析
CNN 有局部性/平移等变先验(样本效率高);ViT 偏置弱(需大数据),但数据充足时上限更高。
【AI 核心深度 M6-003】解释 Swin Transformer 的窗口注意力与层级设计。(Shifted Window Attention and Hierarchical Architecture in Swin Transformer)深度数理推导与工程落地解析
局部窗口内做注意力(O(N)),相邻层用移动窗口实现跨窗口通信,并用 patch merging 做层级下采样。
【AI 核心深度 M6-004】解释自监督视觉预训练的主要范式。(Self-Supervised Visual Pre-training Paradigms: Contrastive vs. Masked Image Modeling)深度数理推导与工程落地解析
对比式(SimCLR/MoCo/CLIP)、掩码重建式(MAE/BEiT)、自蒸馏式(DINO/DINOv2)、以及多模态对齐式。
【AI 核心深度 M6-005】解释视觉编码器的输出如何与语言模型对齐。(Aligning Vision Encoder Representations with Language Model Embedding Spaces)深度数理推导与工程落地解析
视觉塔输出 patch token,经连接器投影到 LLM 的词嵌入空间,作为’视觉 token’与文本拼接送入 LLM。
【AI 核心深度 M6-006】解释视觉 token 数量对成本的影响。(Computational Cost Scaling of Visual Token Counts in Multimodal Transformers)深度数理推导与工程落地解析
视觉 token 数 ∝ 分辨率²/patch²;它同时占用 LLM 的注意力成本(O(L²))与上下文预算,是 VLM 成本主因。
【AI 核心深度 M6-007】解释视觉编码器的选择(CLIP-ViT / SigLIP / DINOv2)与各自特点。(Vision Encoder Selection: CLIP-ViT vs. SigLIP vs. DINOv2 Comparative Trade-offs)深度数理推导与工程落地解析
CLIP-ViT 语言对齐、生态成熟;SigLIP 用 sigmoid 损失更高效、质量更好;DINOv2 纯视觉语义强、适合密集任务。
【AI 核心深度 M6-008】写出 CLIP 的对称 InfoNCE 损失。(Symmetric InfoNCE Loss Formulation and Dual Contrastive Objectives in CLIP)深度数理推导与工程落地解析
在同一 batch 内,图像与文本的配对为正、非配对为负;用对称的图文/文图两个方向计算交叉熵。
【AI 核心深度 M6-009】解释 SigLIP 相对 CLIP 的改进。(SigLIP vs. CLIP: Sigmoid Loss Formulation and Decoupled Batch Size Scaling)深度数理推导与工程落地解析
把 softmax 对比损失换成逐对 sigmoid 损失,无需全局归一化;训练更高效、小 batch 可用、质量更好。