AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M6-052】解释 Classifier-Free Guidance 的公式与作用。(Classifier-Free Guidance (CFG): Mathematical Formulation and Conditional Steering)深度数理推导与工程落地解析
用’条件预测’与’无条件预测’的差放大条件影响:ε̂=ε(∅)+s(ε(c)−ε(∅));s>1 增强条件遵循、降低多样性。
【AI 核心深度 M6-053】比较 classifier guidance 与 CFG。(Classifier Guidance vs Classifier-Free Guidance: Gradients, Joint Training, and Trade-offs)深度数理推导与工程落地解析
classifier guidance 需额外训练分类器并对 score 求梯度;CFG 用同一模型的条件/无条件预测,无需额外模型、更简单且效果更好。
【AI 核心深度 M6-054】解释 guidance scale 的权衡。(Guidance Scale Dynamics: Sample Quality, Mode Collapse, and Over-Saturation Boundaries)深度数理推导与工程落地解析
s 越大越贴合 prompt 但多样性下降、易过饱和;s 太小则忽略 prompt;需按任务调(常用 5~12)。
【AI 核心深度 M6-055】解释采样器(solver)对质量的影响。(Numerical ODE Solvers in Diffusion Sampling: Accuracy, Discretization Errors, and Efficiency)深度数理推导与工程落地解析
同一模型换采样器会显著改变质量与速度:DDIM/DPM-Solver 用更少步达同等质量;Euler-a 细节更丰富。
【AI 核心深度 M6-056】解释扩散采样的随机性与可复现性。(Stochasticity vs Reproducibility in Diffusion Sampling: Seeds, Noise Invariance, and Hardware Drift)深度数理推导与工程落地解析
SDE 采样(DDPM/Euler-a)不可复现;确定性采样(DDIM/DPM-Solver)给定种子可复现;需固定种子与确定性算子。
【AI 核心深度 M6-057】解释扩散模型的潜在空间编辑(SDEdit / inversion)。(Latent Space Image Editing: SDEdit Noise-Denoise vs Deterministic DDIM Inversion)深度数理推导与工程落地解析
SDEdit:加噪到中间步再用新提示去噪;inversion:用确定性采样把图像反推到噪声,再改提示重生成。
【AI 核心深度 M6-044】解释 DDPM 与 DDIM 的采样差异。(Sampling Dynamics: Stochastic DDPM vs Deterministic DDIM Non-Markovian Acceleration)深度数理推导与工程落地解析
DDPM 是随机采样(每步加噪);DDIM 是确定性采样(可跳步、更少步数),同一训练模型可用两种采样。
【AI 核心深度 M6-029】解释视觉 token 压缩的常见方法。(Visual Token Compression Paradigms: Spatial Pooling, Attention Pruning, and Cross-Attention Bottlenecks)深度数理推导与工程落地解析
池化(相邻 patch 合并)、查询压缩(Q-Former/Resampler)、注意力池化、以及学习式剪枝;代价是细节损失。
【AI 核心深度 M6-030】解释视觉 token 与文本 token 的预算分配问题。(Context Budget Allocation and Information Density Balancing Between Vision and Text Tokens)深度数理推导与工程落地解析
总长度受上下文限制;视觉 token 多则文本少;需按任务分配(文档多给视觉、对话多给文本)并压缩。
【AI 核心深度 M6-031】解释动态分辨率对 OCR 与文档理解的影响。(Impact of Dynamic High Resolution on Optical Character Recognition and Document Understanding)深度数理推导与工程落地解析
OCR 需要高分辨率(小字),动态分辨率使小字可辨;但 token 成本高,需配合压缩与分块。
【AI 核心深度 M6-032】描述 VLM 的典型三阶段训练流程。(The Canonical Three-Stage Training Pipeline of Multimodal Large Language Models)深度数理推导与工程落地解析
① 对齐(只训连接器)→ ② 指令微调(解冻 LLM)→ ③ 可选的对齐/偏好优化(DPO)。
【AI 核心深度 M6-033】列举 VLM 的主要评估基准与能力维度。(Multimodal Benchmark Taxonomy and Dimensional Capability Evaluation in VLMs)深度数理推导与工程落地解析
维度:识别/OCR/文档/图表/空间/推理/知识/多图/视频;基准:MMMU/MMBench/MMVP/DocVQA/ChartQA/RealWorldQA。
【AI 核心深度 M6-034】解释 VLM 幻觉的类型与缓解。(Taxonomy, Detection, and Mitigation of Object and Relational Hallucinations in VLMs)深度数理推导与工程落地解析
类型:物体存在性、属性、关系、OCR;缓解:细粒度偏好数据、负样本、RLHF、高分辨率、证据约束。
【AI 核心深度 M6-035】解释 grounding 能力与它的训练数据。(Visual Grounding Mechanics, Coordinate Tokenization, and Training Data Formats)深度数理推导与工程落地解析
grounding 指把语言指向图像的具体区域(输出框/点);训练需’区域-文本’标注数据(检测框、指代分割)。
【AI 核心深度 M6-036】解释 VLM 在多图与视频上的评估难点。(Evaluation Bottlenecks and Benchmarking Challenges in Multi-Image and Video VLMs)深度数理推导与工程落地解析
多图需评’跨图比较/关系’;视频需评’时序/因果/长程’;两者都受 token 预算与采样策略影响。