Tag: module-m6
-
【AI 核心深度 M6-055】解释采样器(solver)对质量的影响。(Numerical ODE Solvers in Diffusion Sampling: Accuracy, Discretization Errors, and Efficiency)深度数理推导与工程落地解析
同一模型换采样器会显著改变质量与速度:DDIM/DPM-Solver 用更少步达同等质量;Euler-a 细节更丰富。
-
【AI 核心深度 M6-056】解释扩散采样的随机性与可复现性。(Stochasticity vs Reproducibility in Diffusion Sampling: Seeds, Noise Invariance, and Hardware Drift)深度数理推导与工程落地解析
SDE 采样(DDPM/Euler-a)不可复现;确定性采样(DDIM/DPM-Solver)给定种子可复现;需固定种子与确定性算子。
-
【AI 核心深度 M6-057】解释扩散模型的潜在空间编辑(SDEdit / inversion)。(Latent Space Image Editing: SDEdit Noise-Denoise vs Deterministic DDIM Inversion)深度数理推导与工程落地解析
SDEdit:加噪到中间步再用新提示去噪;inversion:用确定性采样把图像反推到噪声,再改提示重生成。
-
【AI 核心深度 M6-044】解释 DDPM 与 DDIM 的采样差异。(Sampling Dynamics: Stochastic DDPM vs Deterministic DDIM Non-Markovian Acceleration)深度数理推导与工程落地解析
DDPM 是随机采样(每步加噪);DDIM 是确定性采样(可跳步、更少步数),同一训练模型可用两种采样。
-
【AI 核心深度 M6-029】解释视觉 token 压缩的常见方法。(Visual Token Compression Paradigms: Spatial Pooling, Attention Pruning, and Cross-Attention Bottlenecks)深度数理推导与工程落地解析
池化(相邻 patch 合并)、查询压缩(Q-Former/Resampler)、注意力池化、以及学习式剪枝;代价是细节损失。
-
【AI 核心深度 M6-030】解释视觉 token 与文本 token 的预算分配问题。(Context Budget Allocation and Information Density Balancing Between Vision and Text Tokens)深度数理推导与工程落地解析
总长度受上下文限制;视觉 token 多则文本少;需按任务分配(文档多给视觉、对话多给文本)并压缩。
-
【AI 核心深度 M6-031】解释动态分辨率对 OCR 与文档理解的影响。(Impact of Dynamic High Resolution on Optical Character Recognition and Document Understanding)深度数理推导与工程落地解析
OCR 需要高分辨率(小字),动态分辨率使小字可辨;但 token 成本高,需配合压缩与分块。
-
【AI 核心深度 M6-032】描述 VLM 的典型三阶段训练流程。(The Canonical Three-Stage Training Pipeline of Multimodal Large Language Models)深度数理推导与工程落地解析
① 对齐(只训连接器)→ ② 指令微调(解冻 LLM)→ ③ 可选的对齐/偏好优化(DPO)。
-
【AI 核心深度 M6-033】列举 VLM 的主要评估基准与能力维度。(Multimodal Benchmark Taxonomy and Dimensional Capability Evaluation in VLMs)深度数理推导与工程落地解析
维度:识别/OCR/文档/图表/空间/推理/知识/多图/视频;基准:MMMU/MMBench/MMVP/DocVQA/ChartQA/RealWorldQA。
-
【AI 核心深度 M6-034】解释 VLM 幻觉的类型与缓解。(Taxonomy, Detection, and Mitigation of Object and Relational Hallucinations in VLMs)深度数理推导与工程落地解析
类型:物体存在性、属性、关系、OCR;缓解:细粒度偏好数据、负样本、RLHF、高分辨率、证据约束。