Tag: vision-language-alignment-clip
-
【AI 核心深度 M6-015】解释 CLIP 的模态间隙(modality gap)。(Geometric Foundations and Origin of the Modality Gap in Contrastive Multimodal Encoders)深度数理推导与工程落地解析
图像与文本嵌入在共享空间中形成两个分离的锥形区域(模态间隙),故相似度只在模态内可比。
-
【AI 核心深度 M6-016】解释对比学习的温度参数与可学习温度。(Temperature Hyperparameter Dynamics and Learnable Scaling in Contrastive InfoNCE Loss)深度数理推导与工程落地解析
τ 控制 softmax 的锐度;CLIP 用可学习温度(logit scale),自动调节’难负样本’的权重。
-
【AI 核心深度 M6-017】解释 CLIP 的评估基准与分布偏移鲁棒性。(Evaluation Benchmarks and Out-of-Distribution Robustness in CLIP)深度数理推导与工程落地解析
ImageNet 零样本是主基准;更关键的是分布偏移基准(ImageNet-R/A/Sketch/ObjectNet),CLIP 在那里常优于监督模型。
-
【AI 核心深度 M6-008】写出 CLIP 的对称 InfoNCE 损失。(Symmetric InfoNCE Loss Formulation and Dual Contrastive Objectives in CLIP)深度数理推导与工程落地解析
在同一 batch 内,图像与文本的配对为正、非配对为负;用对称的图文/文图两个方向计算交叉熵。
-
【AI 核心深度 M6-009】解释 SigLIP 相对 CLIP 的改进。(SigLIP vs. CLIP: Sigmoid Loss Formulation and Decoupled Batch Size Scaling)深度数理推导与工程落地解析
把 softmax 对比损失换成逐对 sigmoid 损失,无需全局归一化;训练更高效、小 batch 可用、质量更好。
-
【AI 核心深度 M6-010】解释 CLIP 的能力边界与局限。(Capability Frontiers and Structural Limitations of Contrastive Vision-Language Pre-training)深度数理推导与工程落地解析
擅长’整体语义匹配’,弱于’细粒度空间推理’、计数、OCR、关系理解;且受训练数据偏置影响。
-
【AI 核心深度 M6-011】解释对比学习中的负样本与 batch size 的关系。(Negative Sample Dynamics and Batch Size Scaling in Contrastive Representation Learning)深度数理推导与工程落地解析
in-batch negatives 数 = B−1;batch 越大负样本越多、效果越好,但成本与通信也越高。
-
【AI 核心深度 M6-012】解释 CLIP 在检索中的应用与分数融合。(Cross-Modal Retrieval Architectures and Hybrid Score Fusion with CLIP)深度数理推导与工程落地解析
用嵌入相似度做跨模态检索;实践中与 BM25/元数据/多模型分数融合(加权/学习式)提升效果。
-
【AI 核心深度 M6-013】解释 CLIP 的零样本分类机制。(Zero-Shot Classification Mechanics and Prompt Engineering in CLIP)深度数理推导与工程落地解析
把类别名写成 prompt(’a photo of a {}’),用文本塔编码为’分类器权重’,与图像嵌入比对取最大。
-
【AI 核心深度 M6-014】解释 CLIP 训练的数据规模与噪声(Alt-text 的噪声标签)。(Web-Scale Alt-Text Data Quality, Noise Robustness, and Filtering in CLIP Training)深度数理推导与工程落地解析
4 亿网络图文对,alt-text 与图像常不精确匹配(噪声);大规模 + 大 batch 使其鲁棒,但噪声仍限制上限。