Tag: module-m6
-
【AI 核心深度 M6-035】解释 grounding 能力与它的训练数据。(Visual Grounding Mechanics, Coordinate Tokenization, and Training Data Formats)深度数理推导与工程落地解析
grounding 指把语言指向图像的具体区域(输出框/点);训练需’区域-文本’标注数据(检测框、指代分割)。
-
【AI 核心深度 M6-036】解释 VLM 在多图与视频上的评估难点。(Evaluation Bottlenecks and Benchmarking Challenges in Multi-Image and Video VLMs)深度数理推导与工程落地解析
多图需评’跨图比较/关系’;视频需评’时序/因果/长程’;两者都受 token 预算与采样策略影响。
-
【AI 核心深度 M6-037】解释 VLM 的效率优化方向。(System-Level Efficiency Optimization Frontiers in Multimodal LLM Serving)深度数理推导与工程落地解析
减少视觉 token(压缩/剪枝)、降低分辨率、KV cache 优化、批处理与算子融合、以及两阶段(粗筛+细看)。
-
【AI 核心深度 M6-038】解释 VLM 指令微调数据的构造与质量控制。(Multimodal Instruction Tuning Data Synthesis and Quality Control Protocols)深度数理推导与工程落地解析
用强模型(GPT-4)生成多模态指令数据(LLaVA-Instruct 范式);需覆盖多样任务、保证答案准确、并做质量过滤。
-
【AI 核心深度 M6-039】解释 VLM 评估基准(MMMU / MMBench / MMVP)的特点与陷阱。(Comparative Analysis and Evaluation Pitfalls of MMMU, MMBench, and MMVP)深度数理推导与工程落地解析
MMMU 测学科推理(难)、MMBench 测多维能力(细)、MMVP 测’是否真看图’(反捷径);各有陷阱。
-
【AI 核心深度 M6-040】解释 VLM 的偏见与安全评估。(Multimodal Safety Evaluation, Jailbreak Vectors, and Demographic Bias Auditing)深度数理推导与工程落地解析
VLM 会继承图文数据的社会偏见(性别/种族)并可能生成不安全内容;需专门的偏见与安全基准。
-
【AI 核心深度 M6-041】解释 VLM 的多语言与跨文化能力(训练与评估)。(Multilingual and Cross-Cultural Alignment in Vision-Language Models)深度数理推导与工程落地解析
VLM 的文本塔与训练数据以英语为主,故非英语与跨文化场景表现差;需多语言数据与专门评估。
-
【AI 核心深度 M6-042】写出扩散的前向过程与闭式解。(Forward Diffusion Process Formulation, Markov Chain Dynamics, and Closed-Form Marginal Distribution)深度数理推导与工程落地解析
前向逐步加噪 q(x_t|x_{t-1})=N(√(1-β_t)x_{t-1}, β_t I);闭式解可直接从 x_0 采样任意 t 的 x_t。
-
【AI 核心深度 M6-043】写出 DDPM 的简化训练损失,并说明网络预测什么。(DDPM Simplified Training Objective and Noise Prediction Formulation)深度数理推导与工程落地解析
网络预测噪声 ε:L=E[‖ε−ε_θ(x_t,t)‖²];训练时随机采 t、用闭式解构造 x_t、回归所加的噪声。
-
【AI 核心深度 M6-015】解释 CLIP 的模态间隙(modality gap)。(Geometric Foundations and Origin of the Modality Gap in Contrastive Multimodal Encoders)深度数理推导与工程落地解析
图像与文本嵌入在共享空间中形成两个分离的锥形区域(模态间隙),故相似度只在模态内可比。