Tag: vlm-connectors-projections
-
【AI 核心深度 M6-018】解释 LLaVA 的 MLP 投影器设计。(LLaVA Two-Layer MLP Projector Design and Mathematical Mechanics)深度数理推导与工程落地解析
用两层 MLP 把 ViT 的 patch token 投影到 LLM 词嵌入空间;简单有效,保留所有视觉 token。
-
【AI 核心深度 M6-019】解释 BLIP-2 的 Q-Former 与它的作用。(BLIP-2 Q-Former Architecture and Two-Stage Information Bottleneck)深度数理推导与工程落地解析
用一组可学习的查询 token 通过交叉注意力’抽取’视觉信息,把 N 个 patch token 压缩为固定 K 个。
-
【AI 核心深度 M6-020】比较 MLP、Q-Former、Perceiver Resampler 三类连接器。(Comparative Analysis of Multimodal Connectors: MLP vs Q-Former vs Perceiver Resampler)深度数理推导与工程落地解析
MLP 不压缩、逐 token、最简单;Q-Former 用查询压缩为固定 K;Perceiver Resampler 类似但更轻量、可处理变长输入。
-
【AI 核心深度 M6-021】解释原生多模态(early fusion)架构与后期融合的差异。(Early Fusion Native Multimodal Architectures vs Late Fusion Modular VLMs)深度数理推导与工程落地解析
后期融合:各模态独立编码后拼接;早期融合:用统一 tokenizer 把所有模态转为 token,从底层就混合。
-
【AI 核心深度 M6-022】解释连接器的训练策略(冻结 vs 联合训练)。(Multimodal Connector Training Protocols: Staged Freezing vs Joint Optimization)深度数理推导与工程落地解析
阶段一冻结视觉塔与 LLM 只训连接器(对齐);阶段二解冻 LLM(或部分解冻视觉塔)联合微调。
-
【AI 核心深度 M6-023】解释多图与交错输入(interleaved)的处理。(Multi-Image and Interleaved Image-Text Processing in Multimodal LLMs)深度数理推导与工程落地解析
多图:把多张图的视觉 token 拼接(用分隔符标记);交错:按原文顺序插入图文 token,需位置编码与注意力设计支持。
-
【AI 核心深度 M6-024】解释 VLM 中视觉 token 的放置位置(前置 / 后置 / 交错)与影响。(Visual Token Placement Strategies: Prefix vs Suffix vs Interleaved Positional Dynamics)深度数理推导与工程落地解析
视觉 token 通常放在文本前(前置)或按需插入(交错);位置影响注意力可见性与衰减,且训练推理必须一致。