Tag: module-m6
-
【AI 核心深度 M6-062】解释 VAE 在 Latent Diffusion 中的角色与训练。(Variational Autoencoders in Latent Diffusion: Compression, Regularization, and Training)深度数理推导与工程落地解析
VAE 提供’感知压缩’的潜空间(8 倍下采样);用重建 + 感知 + 对抗损失训练,需平衡压缩率与重建质量。
-
【AI 核心深度 M6-063】解释 CFG 在 DiT 中的实现与成本。(Implementation and Batch Processing of Classifier-Free Guidance in DiT Backbones)深度数理推导与工程落地解析
DiT 用 adaLN 注入条件,故’无条件’即把条件置空;实现上用 batch 拼接一次前向,成本仍 ×2(FLOPs)。
-
【AI 核心深度 M6-064】解释分辨率外推与训练分辨率的关系。(Resolution Extrapolation, RoPE Scaling, and Multi-Aspect Training in DiT)深度数理推导与工程落地解析
在固定分辨率训练的模型对’训练分辨率之外的尺寸’表现差(构图崩坏);需多分辨率训练或专门的插值/调整。
-
【AI 核心深度 M6-065】解释 DiT 的 patchify 与潜空间序列长度。(DiT Patchification Mechanics and Latent Space Token Sequence Length Scaling)深度数理推导与工程落地解析
DiT 把潜变量切成 patch 并展平为序列;序列长度 = (h/p)×(w/p),决定注意力的 O(N²) 成本。
-
【AI 核心深度 M6-066】解释潜空间自编码器的选择(连续 VAE vs VQ-VAE)。(Latent Autoencoder Selection: Continuous KL-Regularized VAE vs Discrete VQ-VAE)深度数理推导与工程落地解析
扩散用连续 VAE(潜空间连续、可加噪);自回归生成用 VQ-VAE(离散 token、可建模);两者不可互换。
-
【AI 核心深度 M6-067】解释 Flow Matching 的核心目标与训练损失。(Flow Matching Foundations, Vector Field Regression, and CNF Objectives)深度数理推导与工程落地解析
学习一个向量场 v_θ(x,t) 使 ODE dx/dt=v 把噪声输运到数据;用回归’条件向量场’的 MSE 训练。
-
【AI 核心深度 M6-068】解释 Rectified Flow / Reflow 的作用。(Rectified Flow, Straight Trajectories, and the Reflow Iteration Protocol)深度数理推导与工程落地解析
Reflow 用当前模型生成配对 (x_0,x_1),再用直线路径重新训练,使路径更直(少步采样质量更好);可迭代。
-
【AI 核心深度 M6-069】解释条件流匹配与边缘流匹配的差异。(Conditional Flow Matching vs Marginal Flow Matching: Tractability and Equivalence)深度数理推导与工程落地解析
边缘流匹配的目标不可计算(需知道整个分布);条件流匹配用可采样的条件路径,且其梯度与边缘相同。
-
【AI 核心深度 M6-070】解释 Flow Matching 与 score matching 的关系。(Interconnection Between Flow Matching and Score-Based Denoising)深度数理推导与工程落地解析
两者都是’用可计算的条件量回归不可计算的边缘量’:FM 回归条件速度、score matching 回归条件 score;扩散是两者的桥梁。
-
【AI 核心深度 M6-071】解释 Flow Matching 中的路径选择与最优传输。(Path Geometries and Optimal Transport Interpolants in Flow Matching)深度数理推导与工程落地解析
路径可选直线/扩散/OT;OT 路径(最优传输)使路径尽量不交叉,从而少步采样质量更好。