Tag: science-depth
-
【AI 核心深度 M6-005】解释视觉编码器的输出如何与语言模型对齐。(Aligning Vision Encoder Representations with Language Model Embedding Spaces)深度数理推导与工程落地解析
视觉塔输出 patch token,经连接器投影到 LLM 的词嵌入空间,作为’视觉 token’与文本拼接送入 LLM。
-
【AI 核心深度 M6-006】解释视觉 token 数量对成本的影响。(Computational Cost Scaling of Visual Token Counts in Multimodal Transformers)深度数理推导与工程落地解析
视觉 token 数 ∝ 分辨率²/patch²;它同时占用 LLM 的注意力成本(O(L²))与上下文预算,是 VLM 成本主因。
-
【AI 核心深度 M6-007】解释视觉编码器的选择(CLIP-ViT / SigLIP / DINOv2)与各自特点。(Vision Encoder Selection: CLIP-ViT vs. SigLIP vs. DINOv2 Comparative Trade-offs)深度数理推导与工程落地解析
CLIP-ViT 语言对齐、生态成熟;SigLIP 用 sigmoid 损失更高效、质量更好;DINOv2 纯视觉语义强、适合密集任务。
-
【AI 核心深度 M6-008】写出 CLIP 的对称 InfoNCE 损失。(Symmetric InfoNCE Loss Formulation and Dual Contrastive Objectives in CLIP)深度数理推导与工程落地解析
在同一 batch 内,图像与文本的配对为正、非配对为负;用对称的图文/文图两个方向计算交叉熵。
-
【AI 核心深度 M6-009】解释 SigLIP 相对 CLIP 的改进。(SigLIP vs. CLIP: Sigmoid Loss Formulation and Decoupled Batch Size Scaling)深度数理推导与工程落地解析
把 softmax 对比损失换成逐对 sigmoid 损失,无需全局归一化;训练更高效、小 batch 可用、质量更好。
-
【AI 核心深度 M6-010】解释 CLIP 的能力边界与局限。(Capability Frontiers and Structural Limitations of Contrastive Vision-Language Pre-training)深度数理推导与工程落地解析
擅长’整体语义匹配’,弱于’细粒度空间推理’、计数、OCR、关系理解;且受训练数据偏置影响。
-
【AI 核心深度 M6-011】解释对比学习中的负样本与 batch size 的关系。(Negative Sample Dynamics and Batch Size Scaling in Contrastive Representation Learning)深度数理推导与工程落地解析
in-batch negatives 数 = B−1;batch 越大负样本越多、效果越好,但成本与通信也越高。
-
【AI 核心深度 M6-012】解释 CLIP 在检索中的应用与分数融合。(Cross-Modal Retrieval Architectures and Hybrid Score Fusion with CLIP)深度数理推导与工程落地解析
用嵌入相似度做跨模态检索;实践中与 BM25/元数据/多模型分数融合(加权/学习式)提升效果。
-
【AI 核心深度 M6-013】解释 CLIP 的零样本分类机制。(Zero-Shot Classification Mechanics and Prompt Engineering in CLIP)深度数理推导与工程落地解析
把类别名写成 prompt(’a photo of a {}’),用文本塔编码为’分类器权重’,与图像嵌入比对取最大。
-
【AI 核心深度 M6-014】解释 CLIP 训练的数据规模与噪声(Alt-text 的噪声标签)。(Web-Scale Alt-Text Data Quality, Noise Robustness, and Filtering in CLIP Training)深度数理推导与工程落地解析
4 亿网络图文对,alt-text 与图像常不精确匹配(噪声);大规模 + 大 batch 使其鲁棒,但噪声仍限制上限。