Tag: machine-learning
-
【AI 核心深度 M6-051】解释扩散模型的 SDE 与 ODE 采样。(Continuous-Time Diffusion Formulations: Forward/Reverse SDEs and Probability Flow ODEs)深度数理推导与工程落地解析
反向 SDE(随机,DDPM/Euler-a)与概率流 ODE(确定,DDIM/DPM-Solver)有相同边缘分布;ODE 可大步长、SDE 多样性更高。
-
【AI 核心深度 M6-052】解释 Classifier-Free Guidance 的公式与作用。(Classifier-Free Guidance (CFG): Mathematical Formulation and Conditional Steering)深度数理推导与工程落地解析
用’条件预测’与’无条件预测’的差放大条件影响:ε̂=ε(∅)+s(ε(c)−ε(∅));s>1 增强条件遵循、降低多样性。
-
【AI 核心深度 M6-053】比较 classifier guidance 与 CFG。(Classifier Guidance vs Classifier-Free Guidance: Gradients, Joint Training, and Trade-offs)深度数理推导与工程落地解析
classifier guidance 需额外训练分类器并对 score 求梯度;CFG 用同一模型的条件/无条件预测,无需额外模型、更简单且效果更好。
-
【AI 核心深度 M6-054】解释 guidance scale 的权衡。(Guidance Scale Dynamics: Sample Quality, Mode Collapse, and Over-Saturation Boundaries)深度数理推导与工程落地解析
s 越大越贴合 prompt 但多样性下降、易过饱和;s 太小则忽略 prompt;需按任务调(常用 5~12)。
-
【AI 核心深度 M6-055】解释采样器(solver)对质量的影响。(Numerical ODE Solvers in Diffusion Sampling: Accuracy, Discretization Errors, and Efficiency)深度数理推导与工程落地解析
同一模型换采样器会显著改变质量与速度:DDIM/DPM-Solver 用更少步达同等质量;Euler-a 细节更丰富。
-
【AI 核心深度 M6-056】解释扩散采样的随机性与可复现性。(Stochasticity vs Reproducibility in Diffusion Sampling: Seeds, Noise Invariance, and Hardware Drift)深度数理推导与工程落地解析
SDE 采样(DDPM/Euler-a)不可复现;确定性采样(DDIM/DPM-Solver)给定种子可复现;需固定种子与确定性算子。
-
【AI 核心深度 M6-057】解释扩散模型的潜在空间编辑(SDEdit / inversion)。(Latent Space Image Editing: SDEdit Noise-Denoise vs Deterministic DDIM Inversion)深度数理推导与工程落地解析
SDEdit:加噪到中间步再用新提示去噪;inversion:用确定性采样把图像反推到噪声,再改提示重生成。
-
【AI 核心深度 M6-044】解释 DDPM 与 DDIM 的采样差异。(Sampling Dynamics: Stochastic DDPM vs Deterministic DDIM Non-Markovian Acceleration)深度数理推导与工程落地解析
DDPM 是随机采样(每步加噪);DDIM 是确定性采样(可跳步、更少步数),同一训练模型可用两种采样。
-
【AI 核心深度 M6-029】解释视觉 token 压缩的常见方法。(Visual Token Compression Paradigms: Spatial Pooling, Attention Pruning, and Cross-Attention Bottlenecks)深度数理推导与工程落地解析
池化(相邻 patch 合并)、查询压缩(Q-Former/Resampler)、注意力池化、以及学习式剪枝;代价是细节损失。
-
【AI 核心深度 M6-030】解释视觉 token 与文本 token 的预算分配问题。(Context Budget Allocation and Information Density Balancing Between Vision and Text Tokens)深度数理推导与工程落地解析
总长度受上下文限制;视觉 token 多则文本少;需按任务分配(文档多给视觉、对话多给文本)并压缩。