Tag: controllable-generation-image-editing
-
【AI 核心深度 M6-079】解释 ControlNet 的机制。(ControlNet Architectural Mechanics: Zero Convolutions and Trainable Encoders)深度数理推导与工程落地解析
复制一份扩散骨干作为’可训练副本’,通过零卷积接回主干,用额外条件(边缘/深度/姿态)精确控制生成结构。
-
【AI 核心深度 M6-080】解释 IP-Adapter 的机制与用途。(IP-Adapter: Decoupled Cross-Attention and Image Prompt Conditioning)深度数理推导与工程落地解析
用一组可学习查询通过解耦的交叉注意力把参考图的语义注入扩散模型,实现’风格/身份’迁移而不改主干。
-
【AI 核心深度 M6-081】解释 inpainting / outpainting 的实现方式。(Image Inpainting and Outpainting: Mask Concatenation, Repaint, and Fourier Convolutions)深度数理推导与工程落地解析
用掩码标记重绘区域,在扩散中让掩码外保持原图(每步替换已知区域),掩码内按 prompt 生成。
-
【AI 核心深度 M6-082】解释商品图保真的技术组合。(Technical Stacks and Preservation Strategies for E-Commerce Product Image Fidelity)深度数理推导与工程落地解析
用’结构控制(ControlNet)+ 外观保持(IP-Adapter/参考图)+ 局部重绘 + 后处理校验’保证商品不变形、细节准确。
-
【AI 核心深度 M6-083】解释文本编辑与属性解耦(prompt editing)。(Text-Guided Image Editing and Attribute Disentanglement Dynamics)深度数理推导与工程落地解析
通过修改 prompt 或注意力图实现’只改某属性’;关键是定位’哪个 token 影响哪个区域’(注意力编辑)。
-
【AI 核心深度 M6-084】解释定制化生成(DreamBooth / Textual Inversion / LoRA)。(Customized Subject Generation: DreamBooth vs Textual Inversion vs LoRA)深度数理推导与工程落地解析
DreamBooth 用少量图微调整个模型绑定新标识符;Textual Inversion 只学新 token 嵌入;LoRA 学低秩增量。
-
【AI 核心深度 M6-085】解释参考图生成(reference-based generation)与身份保持。(Reference-Based Generation and Facial/Subject Identity Preservation)深度数理推导与工程落地解析
用参考图提供’主体/风格’信息,通过 IP-Adapter、参考注意力、或多图微调保持身份;难点是’既像又不完全复制’。