AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M6-064】解释分辨率外推与训练分辨率的关系。(Resolution Extrapolation, RoPE Scaling, and Multi-Aspect Training in DiT)深度数理推导与工程落地解析
在固定分辨率训练的模型对’训练分辨率之外的尺寸’表现差(构图崩坏);需多分辨率训练或专门的插值/调整。
【AI 核心深度 M6-065】解释 DiT 的 patchify 与潜空间序列长度。(DiT Patchification Mechanics and Latent Space Token Sequence Length Scaling)深度数理推导与工程落地解析
DiT 把潜变量切成 patch 并展平为序列;序列长度 = (h/p)×(w/p),决定注意力的 O(N²) 成本。
【AI 核心深度 M6-066】解释潜空间自编码器的选择(连续 VAE vs VQ-VAE)。(Latent Autoencoder Selection: Continuous KL-Regularized VAE vs Discrete VQ-VAE)深度数理推导与工程落地解析
扩散用连续 VAE(潜空间连续、可加噪);自回归生成用 VQ-VAE(离散 token、可建模);两者不可互换。
【AI 核心深度 M6-067】解释 Flow Matching 的核心目标与训练损失。(Flow Matching Foundations, Vector Field Regression, and CNF Objectives)深度数理推导与工程落地解析
学习一个向量场 v_θ(x,t) 使 ODE dx/dt=v 把噪声输运到数据;用回归’条件向量场’的 MSE 训练。
【AI 核心深度 M6-068】解释 Rectified Flow / Reflow 的作用。(Rectified Flow, Straight Trajectories, and the Reflow Iteration Protocol)深度数理推导与工程落地解析
Reflow 用当前模型生成配对 (x_0,x_1),再用直线路径重新训练,使路径更直(少步采样质量更好);可迭代。
【AI 核心深度 M6-069】解释条件流匹配与边缘流匹配的差异。(Conditional Flow Matching vs Marginal Flow Matching: Tractability and Equivalence)深度数理推导与工程落地解析
边缘流匹配的目标不可计算(需知道整个分布);条件流匹配用可采样的条件路径,且其梯度与边缘相同。
【AI 核心深度 M6-070】解释 Flow Matching 与 score matching 的关系。(Interconnection Between Flow Matching and Score-Based Denoising)深度数理推导与工程落地解析
两者都是’用可计算的条件量回归不可计算的边缘量’:FM 回归条件速度、score matching 回归条件 score;扩散是两者的桥梁。
【AI 核心深度 M6-071】解释 Flow Matching 中的路径选择与最优传输。(Path Geometries and Optimal Transport Interpolants in Flow Matching)深度数理推导与工程落地解析
路径可选直线/扩散/OT;OT 路径(最优传输)使路径尽量不交叉,从而少步采样质量更好。
【AI 核心深度 M6-045】解释噪声调度(linear vs cosine)的影响。(Noise Scheduling Dynamics: Linear vs Cosine Variance Schedules and SNR Boundaries)深度数理推导与工程落地解析
调度决定各时间步的信噪比分布;linear 在两端浪费(中间信噪比变化快),cosine 更均匀,质量更好。
【AI 核心深度 M6-046】解释扩散模型的 ELBO 与简化损失的差异。(Mathematical Derivation of the Diffusion Variational Lower Bound (ELBO) vs Simplified Objective)深度数理推导与工程落地解析
ELBO 给出各时间步加权的 MSE;DDPM 的简化损失去掉权重用均匀 MSE,实践效果更好但不再是严格的似然下界。
【AI 核心深度 M6-047】解释扩散模型的推理加速路线。(Inference Acceleration Paradigms for Diffusion Models: Solvers, Distillation, and Flow Matching)深度数理推导与工程落地解析
减少步数(高阶求解器/蒸馏)、缓存复用、并行化、以及潜空间压缩(LDM)与量化。
【AI 核心深度 M6-048】解释 score matching 与扩散的关系。(Score-Based Generative Modeling and Equivalence with Denoising Diffusion Probabilistic Models)深度数理推导与工程落地解析
扩散的 ε 预测等价于估计 score(∇log p);去噪 score matching 提供了扩散损失的另一种(统一的)推导。
【AI 核心深度 M6-049】解释 v-prediction 与 epsilon-prediction 的差异。(Velocity v-Prediction vs Epsilon-Prediction in Diffusion Models: SNR Stability and Extreme Noise Regimes)深度数理推导与工程落地解析
ε-prediction 在高噪声区难(信号弱);x_0-prediction 在低噪声区难;v-prediction 是两者的平衡,各 SNR 区间难度更均匀。
【AI 核心深度 M6-050】解释扩散模型的条件注入方式(cross-attention / concat / adaLN)。(Conditioning Mechanisms in Diffusion Models: Cross-Attention, Channel Concatenation, and AdaLN)深度数理推导与工程落地解析
文本条件常用 cross-attention(U-Net)或 adaLN 调制(DiT);类别/低层条件常用 concat;可组合使用。
【AI 核心深度 M6-051】解释扩散模型的 SDE 与 ODE 采样。(Continuous-Time Diffusion Formulations: Forward/Reverse SDEs and Probability Flow ODEs)深度数理推导与工程落地解析
反向 SDE(随机,DDPM/Euler-a)与概率流 ODE(确定,DDIM/DPM-Solver)有相同边缘分布;ODE 可大步长、SDE 多样性更高。