Tag: vlm-training-evaluation
-
【AI 核心深度 M6-032】描述 VLM 的典型三阶段训练流程。(The Canonical Three-Stage Training Pipeline of Multimodal Large Language Models)深度数理推导与工程落地解析
① 对齐(只训连接器)→ ② 指令微调(解冻 LLM)→ ③ 可选的对齐/偏好优化(DPO)。
-
【AI 核心深度 M6-033】列举 VLM 的主要评估基准与能力维度。(Multimodal Benchmark Taxonomy and Dimensional Capability Evaluation in VLMs)深度数理推导与工程落地解析
维度:识别/OCR/文档/图表/空间/推理/知识/多图/视频;基准:MMMU/MMBench/MMVP/DocVQA/ChartQA/RealWorldQA。
-
【AI 核心深度 M6-034】解释 VLM 幻觉的类型与缓解。(Taxonomy, Detection, and Mitigation of Object and Relational Hallucinations in VLMs)深度数理推导与工程落地解析
类型:物体存在性、属性、关系、OCR;缓解:细粒度偏好数据、负样本、RLHF、高分辨率、证据约束。
-
【AI 核心深度 M6-035】解释 grounding 能力与它的训练数据。(Visual Grounding Mechanics, Coordinate Tokenization, and Training Data Formats)深度数理推导与工程落地解析
grounding 指把语言指向图像的具体区域(输出框/点);训练需’区域-文本’标注数据(检测框、指代分割)。
-
【AI 核心深度 M6-036】解释 VLM 在多图与视频上的评估难点。(Evaluation Bottlenecks and Benchmarking Challenges in Multi-Image and Video VLMs)深度数理推导与工程落地解析
多图需评’跨图比较/关系’;视频需评’时序/因果/长程’;两者都受 token 预算与采样策略影响。
-
【AI 核心深度 M6-037】解释 VLM 的效率优化方向。(System-Level Efficiency Optimization Frontiers in Multimodal LLM Serving)深度数理推导与工程落地解析
减少视觉 token(压缩/剪枝)、降低分辨率、KV cache 优化、批处理与算子融合、以及两阶段(粗筛+细看)。
-
【AI 核心深度 M6-038】解释 VLM 指令微调数据的构造与质量控制。(Multimodal Instruction Tuning Data Synthesis and Quality Control Protocols)深度数理推导与工程落地解析
用强模型(GPT-4)生成多模态指令数据(LLaVA-Instruct 范式);需覆盖多样任务、保证答案准确、并做质量过滤。
-
【AI 核心深度 M6-039】解释 VLM 评估基准(MMMU / MMBench / MMVP)的特点与陷阱。(Comparative Analysis and Evaluation Pitfalls of MMMU, MMBench, and MMVP)深度数理推导与工程落地解析
MMMU 测学科推理(难)、MMBench 测多维能力(细)、MMVP 测’是否真看图’(反捷径);各有陷阱。
-
【AI 核心深度 M6-040】解释 VLM 的偏见与安全评估。(Multimodal Safety Evaluation, Jailbreak Vectors, and Demographic Bias Auditing)深度数理推导与工程落地解析
VLM 会继承图文数据的社会偏见(性别/种族)并可能生成不安全内容;需专门的偏见与安全基准。
-
【AI 核心深度 M6-041】解释 VLM 的多语言与跨文化能力(训练与评估)。(Multilingual and Cross-Cultural Alignment in Vision-Language Models)深度数理推导与工程落地解析
VLM 的文本塔与训练数据以英语为主,故非英语与跨文化场景表现差;需多语言数据与专门评估。