Tag: latent-diffusion-dit-architecture
-
【AI 核心深度 M6-076】解释潜空间的语义性与潜空间插值/编辑的可行性。(Latent Space Geometry, Semantic Disentanglement, and Vector Interpolation Feasibility)深度数理推导与工程落地解析
VAE 潜空间是感知压缩(非语义),故插值较平滑但语义解耦弱;语义编辑通常需在条件(文本/属性)层面做。
-
【AI 核心深度 M6-077】解释 DiT 的变体(MMDiT 双流 / U-DiT 多尺度)。(Architectural Variants of Diffusion Transformers: MMDiT Dual-Stream vs U-DiT Hierarchical)深度数理推导与工程落地解析
MMDiT 让文本与图像各用独立权重 + 联合注意力(避免模态干扰);U-DiT 加回多尺度以提升高分辨率表现。
-
【AI 核心深度 M6-059】解释 Latent Diffusion 为什么能省算力。(Computational Efficiency Foundations of Latent Diffusion Models (LDM))深度数理推导与工程落地解析
把扩散过程从像素空间搬到 VAE 的低维潜空间,计算量降 10~100 倍且质量损失小。
-
【AI 核心深度 M6-060】解释 DiT 为什么取代 U-Net。(Architectural Evolution: Why Diffusion Transformers (DiT) Replace Convolutional U-Nets)深度数理推导与工程落地解析
DiT 用纯 Transformer(patchify 潜变量 + adaLN 条件)替代 U-Net,扩展性更好、与 LLM 架构统一、生成质量更高。
-
【AI 核心深度 M6-061】解释 adaLN-Zero 的条件注入机制。(AdaLN-Zero Conditioning Mechanics in Diffusion Transformers)深度数理推导与工程落地解析
用条件生成 scale/shift 调制 LayerNorm,并把调制参数初始化为 0,使训练初始时条件分支为恒等(稳定训练)。
-
【AI 核心深度 M6-062】解释 VAE 在 Latent Diffusion 中的角色与训练。(Variational Autoencoders in Latent Diffusion: Compression, Regularization, and Training)深度数理推导与工程落地解析
VAE 提供’感知压缩’的潜空间(8 倍下采样);用重建 + 感知 + 对抗损失训练,需平衡压缩率与重建质量。
-
【AI 核心深度 M6-063】解释 CFG 在 DiT 中的实现与成本。(Implementation and Batch Processing of Classifier-Free Guidance in DiT Backbones)深度数理推导与工程落地解析
DiT 用 adaLN 注入条件,故’无条件’即把条件置空;实现上用 batch 拼接一次前向,成本仍 ×2(FLOPs)。
-
【AI 核心深度 M6-064】解释分辨率外推与训练分辨率的关系。(Resolution Extrapolation, RoPE Scaling, and Multi-Aspect Training in DiT)深度数理推导与工程落地解析
在固定分辨率训练的模型对’训练分辨率之外的尺寸’表现差(构图崩坏);需多分辨率训练或专门的插值/调整。
-
【AI 核心深度 M6-065】解释 DiT 的 patchify 与潜空间序列长度。(DiT Patchification Mechanics and Latent Space Token Sequence Length Scaling)深度数理推导与工程落地解析
DiT 把潜变量切成 patch 并展平为序列;序列长度 = (h/p)×(w/p),决定注意力的 O(N²) 成本。
-
【AI 核心深度 M6-066】解释潜空间自编码器的选择(连续 VAE vs VQ-VAE)。(Latent Autoencoder Selection: Continuous KL-Regularized VAE vs Discrete VQ-VAE)深度数理推导与工程落地解析
扩散用连续 VAE(潜空间连续、可加噪);自回归生成用 VQ-VAE(离散 token、可建模);两者不可互换。