Tag: machine-learning
-
【AI 核心深度 M6-004】解释自监督视觉预训练的主要范式。(Self-Supervised Visual Pre-training Paradigms: Contrastive vs. Masked Image Modeling)深度数理推导与工程落地解析
对比式(SimCLR/MoCo/CLIP)、掩码重建式(MAE/BEiT)、自蒸馏式(DINO/DINOv2)、以及多模态对齐式。
-
【AI 核心深度 M6-005】解释视觉编码器的输出如何与语言模型对齐。(Aligning Vision Encoder Representations with Language Model Embedding Spaces)深度数理推导与工程落地解析
视觉塔输出 patch token,经连接器投影到 LLM 的词嵌入空间,作为’视觉 token’与文本拼接送入 LLM。
-
【AI 核心深度 M6-006】解释视觉 token 数量对成本的影响。(Computational Cost Scaling of Visual Token Counts in Multimodal Transformers)深度数理推导与工程落地解析
视觉 token 数 ∝ 分辨率²/patch²;它同时占用 LLM 的注意力成本(O(L²))与上下文预算,是 VLM 成本主因。
-
【AI 核心深度 M6-007】解释视觉编码器的选择(CLIP-ViT / SigLIP / DINOv2)与各自特点。(Vision Encoder Selection: CLIP-ViT vs. SigLIP vs. DINOv2 Comparative Trade-offs)深度数理推导与工程落地解析
CLIP-ViT 语言对齐、生态成熟;SigLIP 用 sigmoid 损失更高效、质量更好;DINOv2 纯视觉语义强、适合密集任务。
-
【AI 核心深度 M6-008】写出 CLIP 的对称 InfoNCE 损失。(Symmetric InfoNCE Loss Formulation and Dual Contrastive Objectives in CLIP)深度数理推导与工程落地解析
在同一 batch 内,图像与文本的配对为正、非配对为负;用对称的图文/文图两个方向计算交叉熵。
-
【AI 核心深度 M6-009】解释 SigLIP 相对 CLIP 的改进。(SigLIP vs. CLIP: Sigmoid Loss Formulation and Decoupled Batch Size Scaling)深度数理推导与工程落地解析
把 softmax 对比损失换成逐对 sigmoid 损失,无需全局归一化;训练更高效、小 batch 可用、质量更好。
-
【AI 核心深度 M6-010】解释 CLIP 的能力边界与局限。(Capability Frontiers and Structural Limitations of Contrastive Vision-Language Pre-training)深度数理推导与工程落地解析
擅长’整体语义匹配’,弱于’细粒度空间推理’、计数、OCR、关系理解;且受训练数据偏置影响。
-
【AI 核心深度 M6-011】解释对比学习中的负样本与 batch size 的关系。(Negative Sample Dynamics and Batch Size Scaling in Contrastive Representation Learning)深度数理推导与工程落地解析
in-batch negatives 数 = B−1;batch 越大负样本越多、效果越好,但成本与通信也越高。
-
【AI 核心深度 M6-012】解释 CLIP 在检索中的应用与分数融合。(Cross-Modal Retrieval Architectures and Hybrid Score Fusion with CLIP)深度数理推导与工程落地解析
用嵌入相似度做跨模态检索;实践中与 BM25/元数据/多模型分数融合(加权/学习式)提升效果。
-
【AI 核心深度 M6-013】解释 CLIP 的零样本分类机制。(Zero-Shot Classification Mechanics and Prompt Engineering in CLIP)深度数理推导与工程落地解析
把类别名写成 prompt(’a photo of a {}’),用文本塔编码为’分类器权重’,与图像嵌入比对取最大。