Tag: applied-scientist
-
【AI 核心深度 M6-042】写出扩散的前向过程与闭式解。(Forward Diffusion Process Formulation, Markov Chain Dynamics, and Closed-Form Marginal Distribution)深度数理推导与工程落地解析
前向逐步加噪 q(x_t|x_{t-1})=N(√(1-β_t)x_{t-1}, β_t I);闭式解可直接从 x_0 采样任意 t 的 x_t。
-
【AI 核心深度 M6-043】写出 DDPM 的简化训练损失,并说明网络预测什么。(DDPM Simplified Training Objective and Noise Prediction Formulation)深度数理推导与工程落地解析
网络预测噪声 ε:L=E[‖ε−ε_θ(x_t,t)‖²];训练时随机采 t、用闭式解构造 x_t、回归所加的噪声。
-
【AI 核心深度 M6-015】解释 CLIP 的模态间隙(modality gap)。(Geometric Foundations and Origin of the Modality Gap in Contrastive Multimodal Encoders)深度数理推导与工程落地解析
图像与文本嵌入在共享空间中形成两个分离的锥形区域(模态间隙),故相似度只在模态内可比。
-
【AI 核心深度 M6-016】解释对比学习的温度参数与可学习温度。(Temperature Hyperparameter Dynamics and Learnable Scaling in Contrastive InfoNCE Loss)深度数理推导与工程落地解析
τ 控制 softmax 的锐度;CLIP 用可学习温度(logit scale),自动调节’难负样本’的权重。
-
【AI 核心深度 M6-017】解释 CLIP 的评估基准与分布偏移鲁棒性。(Evaluation Benchmarks and Out-of-Distribution Robustness in CLIP)深度数理推导与工程落地解析
ImageNet 零样本是主基准;更关键的是分布偏移基准(ImageNet-R/A/Sketch/ObjectNet),CLIP 在那里常优于监督模型。
-
【AI 核心深度 M6-018】解释 LLaVA 的 MLP 投影器设计。(LLaVA Two-Layer MLP Projector Design and Mathematical Mechanics)深度数理推导与工程落地解析
用两层 MLP 把 ViT 的 patch token 投影到 LLM 词嵌入空间;简单有效,保留所有视觉 token。
-
【AI 核心深度 M6-019】解释 BLIP-2 的 Q-Former 与它的作用。(BLIP-2 Q-Former Architecture and Two-Stage Information Bottleneck)深度数理推导与工程落地解析
用一组可学习的查询 token 通过交叉注意力’抽取’视觉信息,把 N 个 patch token 压缩为固定 K 个。
-
【AI 核心深度 M6-020】比较 MLP、Q-Former、Perceiver Resampler 三类连接器。(Comparative Analysis of Multimodal Connectors: MLP vs Q-Former vs Perceiver Resampler)深度数理推导与工程落地解析
MLP 不压缩、逐 token、最简单;Q-Former 用查询压缩为固定 K;Perceiver Resampler 类似但更轻量、可处理变长输入。
-
【AI 核心深度 M6-021】解释原生多模态(early fusion)架构与后期融合的差异。(Early Fusion Native Multimodal Architectures vs Late Fusion Modular VLMs)深度数理推导与工程落地解析
后期融合:各模态独立编码后拼接;早期融合:用统一 tokenizer 把所有模态转为 token,从底层就混合。
-
【AI 核心深度 M6-022】解释连接器的训练策略(冻结 vs 联合训练)。(Multimodal Connector Training Protocols: Staged Freezing vs Joint Optimization)深度数理推导与工程落地解析
阶段一冻结视觉塔与 LLM 只训连接器(对齐);阶段二解冻 LLM(或部分解冻视觉塔)联合微调。