Tag: module-m6
-
【AI 核心深度 M6-045】解释噪声调度(linear vs cosine)的影响。(Noise Scheduling Dynamics: Linear vs Cosine Variance Schedules and SNR Boundaries)深度数理推导与工程落地解析
调度决定各时间步的信噪比分布;linear 在两端浪费(中间信噪比变化快),cosine 更均匀,质量更好。
-
【AI 核心深度 M6-046】解释扩散模型的 ELBO 与简化损失的差异。(Mathematical Derivation of the Diffusion Variational Lower Bound (ELBO) vs Simplified Objective)深度数理推导与工程落地解析
ELBO 给出各时间步加权的 MSE;DDPM 的简化损失去掉权重用均匀 MSE,实践效果更好但不再是严格的似然下界。
-
【AI 核心深度 M6-047】解释扩散模型的推理加速路线。(Inference Acceleration Paradigms for Diffusion Models: Solvers, Distillation, and Flow Matching)深度数理推导与工程落地解析
减少步数(高阶求解器/蒸馏)、缓存复用、并行化、以及潜空间压缩(LDM)与量化。
-
【AI 核心深度 M6-048】解释 score matching 与扩散的关系。(Score-Based Generative Modeling and Equivalence with Denoising Diffusion Probabilistic Models)深度数理推导与工程落地解析
扩散的 ε 预测等价于估计 score(∇log p);去噪 score matching 提供了扩散损失的另一种(统一的)推导。
-
【AI 核心深度 M6-049】解释 v-prediction 与 epsilon-prediction 的差异。(Velocity v-Prediction vs Epsilon-Prediction in Diffusion Models: SNR Stability and Extreme Noise Regimes)深度数理推导与工程落地解析
ε-prediction 在高噪声区难(信号弱);x_0-prediction 在低噪声区难;v-prediction 是两者的平衡,各 SNR 区间难度更均匀。
-
【AI 核心深度 M6-050】解释扩散模型的条件注入方式(cross-attention / concat / adaLN)。(Conditioning Mechanisms in Diffusion Models: Cross-Attention, Channel Concatenation, and AdaLN)深度数理推导与工程落地解析
文本条件常用 cross-attention(U-Net)或 adaLN 调制(DiT);类别/低层条件常用 concat;可组合使用。
-
【AI 核心深度 M6-051】解释扩散模型的 SDE 与 ODE 采样。(Continuous-Time Diffusion Formulations: Forward/Reverse SDEs and Probability Flow ODEs)深度数理推导与工程落地解析
反向 SDE(随机,DDPM/Euler-a)与概率流 ODE(确定,DDIM/DPM-Solver)有相同边缘分布;ODE 可大步长、SDE 多样性更高。
-
【AI 核心深度 M6-052】解释 Classifier-Free Guidance 的公式与作用。(Classifier-Free Guidance (CFG): Mathematical Formulation and Conditional Steering)深度数理推导与工程落地解析
用’条件预测’与’无条件预测’的差放大条件影响:ε̂=ε(∅)+s(ε(c)−ε(∅));s>1 增强条件遵循、降低多样性。
-
【AI 核心深度 M6-053】比较 classifier guidance 与 CFG。(Classifier Guidance vs Classifier-Free Guidance: Gradients, Joint Training, and Trade-offs)深度数理推导与工程落地解析
classifier guidance 需额外训练分类器并对 score 求梯度;CFG 用同一模型的条件/无条件预测,无需额外模型、更简单且效果更好。
-
【AI 核心深度 M6-054】解释 guidance scale 的权衡。(Guidance Scale Dynamics: Sample Quality, Mode Collapse, and Over-Saturation Boundaries)深度数理推导与工程落地解析
s 越大越贴合 prompt 但多样性下降、易过饱和;s 太小则忽略 prompt;需按任务调(常用 5~12)。