Tag: module-m4
-
【AI 核心深度 M4-105】解释 LoRA / QLoRA 与全量微调的取舍。(Trade-offs Between LoRA, QLoRA, and Full Fine-Tuning)深度数理推导与工程落地解析
LoRA 用低秩增量(A·B)只训少量参数;QLoRA 再叠加 4-bit 基座量化;全量微调上限最高但显存与灾难遗忘风险大。
-
【AI 核心深度 M4-078】解释 MoE 的微调与部署难点。(Fine-Tuning and Deployment Challenges of MoE Models)深度数理推导与工程落地解析
微调时路由器易漂移/专家过拟合、显存需求大;部署需多卡 EP、计算不规则、延迟不可预测。
-
【AI 核心深度 M4-079】解释共享专家与细粒度专家的设计(DeepSeek-MoE)。(Shared Experts and Fine-Grained Expert Architecture in DeepSeek-MoE)深度数理推导与工程落地解析
共享专家对所有 token 生效(捕捉通用知识),细粒度专家更多更小(组合更灵活),提升专家专业化与效率。
-
【AI 核心深度 M4-080】解释 MoE 的路由算法(Top-k / expert choice / soft routing)与取舍。(MoE Routing Algorithms: Top-k, Expert Choice, and Soft Routing)深度数理推导与工程落地解析
token-choice Top-k 最常见(token 选专家);expert-choice 让专家选 token(天然均衡);soft routing 全加权(失去稀疏优势)。
-
【AI 核心深度 M4-081】解释状态空间模型(SSM)的基本形式。(Fundamental Formulation of State Space Models (SSM))深度数理推导与工程落地解析
用线性递归 h'(t)=Ah(t)+Bx(t)、y=Ch(t) 描述序列;离散化后用卷积或扫描并行计算,复杂度线性。
-
【AI 核心深度 M4-082】解释 Mamba 的选择性机制(selective SSM)。(Selective State Space Models (Selective SSM) in Mamba)深度数理推导与工程落地解析
让 B、C、Δ 依赖输入(时变),使模型能’选择性’记忆或忽略信息;代价是无法用卷积,改用并行扫描。
-
【AI 核心深度 M4-083】比较 SSM 与注意力的复杂度与能力。(Complexity and Expressive Capability: SSM vs. Self-Attention)深度数理推导与工程落地解析
训练:注意力 O(L²) vs SSM O(L);推理:注意力每步 O(L)(KV)vs SSM O(1)(状态);能力:注意力可精确检索,SSM 是压缩记忆。
-
【AI 核心深度 M4-084】解释混合架构(Attention + SSM)的设计动机。(Design Motivations for Hybrid Architectures Combining Attention and SSM)深度数理推导与工程落地解析
用少量注意力层提供精确检索能力,大量 SSM/线性层提供线性复杂度,兼得能力与效率。
-
【AI 核心深度 M4-085】解释 Mamba 的硬件感知实现(并行扫描 + 核融合)。(Mamba Hardware-Aware Implementation: Parallel Scan and Kernel Fusion)深度数理推导与工程落地解析
把离散化、选择性扫描、输出投影融合进一个 kernel,中间数据留在 SRAM,避免 HBM 往返(同 Flash Attention 思想)。
-
【AI 核心深度 M4-086】SSM 的初始化与数值稳定性有什么特殊之处?(SSM Initialization and Numerical Stability: HiPPO Matrix and Discretization Precision)深度数理推导与工程落地解析
A 的初始化决定记忆特性(HiPPO/S4D 用特定结构);离散化 exp(ΔA) 易溢出,需参数化约束(如 A 用负实部)。