Tag: module-m6
-
【AI 核心深度 M6-080】解释 IP-Adapter 的机制与用途。(IP-Adapter: Decoupled Cross-Attention and Image Prompt Conditioning)深度数理推导与工程落地解析
用一组可学习查询通过解耦的交叉注意力把参考图的语义注入扩散模型,实现’风格/身份’迁移而不改主干。
-
【AI 核心深度 M6-081】解释 inpainting / outpainting 的实现方式。(Image Inpainting and Outpainting: Mask Concatenation, Repaint, and Fourier Convolutions)深度数理推导与工程落地解析
用掩码标记重绘区域,在扩散中让掩码外保持原图(每步替换已知区域),掩码内按 prompt 生成。
-
【AI 核心深度 M6-082】解释商品图保真的技术组合。(Technical Stacks and Preservation Strategies for E-Commerce Product Image Fidelity)深度数理推导与工程落地解析
用’结构控制(ControlNet)+ 外观保持(IP-Adapter/参考图)+ 局部重绘 + 后处理校验’保证商品不变形、细节准确。
-
【AI 核心深度 M6-083】解释文本编辑与属性解耦(prompt editing)。(Text-Guided Image Editing and Attribute Disentanglement Dynamics)深度数理推导与工程落地解析
通过修改 prompt 或注意力图实现’只改某属性’;关键是定位’哪个 token 影响哪个区域’(注意力编辑)。
-
【AI 核心深度 M6-084】解释定制化生成(DreamBooth / Textual Inversion / LoRA)。(Customized Subject Generation: DreamBooth vs Textual Inversion vs LoRA)深度数理推导与工程落地解析
DreamBooth 用少量图微调整个模型绑定新标识符;Textual Inversion 只学新 token 嵌入;LoRA 学低秩增量。
-
【AI 核心深度 M6-085】解释参考图生成(reference-based generation)与身份保持。(Reference-Based Generation and Facial/Subject Identity Preservation)深度数理推导与工程落地解析
用参考图提供’主体/风格’信息,通过 IP-Adapter、参考注意力、或多图微调保持身份;难点是’既像又不完全复制’。
-
【AI 核心深度 M6-058】解释 CFG 的双倍前向成本与优化手段。(Computational Overhead of CFG: Dual Forward Passes and Acceleration Mitigations)深度数理推导与工程落地解析
CFG 需条件与无条件两次前向(成本 ×2);可用 CFG distillation、批量并行或近似合并来降低成本。
-
【AI 核心深度 M6-059】解释 Latent Diffusion 为什么能省算力。(Computational Efficiency Foundations of Latent Diffusion Models (LDM))深度数理推导与工程落地解析
把扩散过程从像素空间搬到 VAE 的低维潜空间,计算量降 10~100 倍且质量损失小。
-
【AI 核心深度 M6-060】解释 DiT 为什么取代 U-Net。(Architectural Evolution: Why Diffusion Transformers (DiT) Replace Convolutional U-Nets)深度数理推导与工程落地解析
DiT 用纯 Transformer(patchify 潜变量 + adaLN 条件)替代 U-Net,扩展性更好、与 LLM 架构统一、生成质量更高。
-
【AI 核心深度 M6-061】解释 adaLN-Zero 的条件注入机制。(AdaLN-Zero Conditioning Mechanics in Diffusion Transformers)深度数理推导与工程落地解析
用条件生成 scale/shift 调制 LayerNorm,并把调制参数初始化为 0,使训练初始时条件分支为恒等(稳定训练)。