Tag: mixture-of-experts-moe
-
【AI 核心深度 M4-078】解释 MoE 的微调与部署难点。(Fine-Tuning and Deployment Challenges of MoE Models)深度数理推导与工程落地解析
微调时路由器易漂移/专家过拟合、显存需求大;部署需多卡 EP、计算不规则、延迟不可预测。
-
【AI 核心深度 M4-079】解释共享专家与细粒度专家的设计(DeepSeek-MoE)。(Shared Experts and Fine-Grained Expert Architecture in DeepSeek-MoE)深度数理推导与工程落地解析
共享专家对所有 token 生效(捕捉通用知识),细粒度专家更多更小(组合更灵活),提升专家专业化与效率。
-
【AI 核心深度 M4-080】解释 MoE 的路由算法(Top-k / expert choice / soft routing)与取舍。(MoE Routing Algorithms: Top-k, Expert Choice, and Soft Routing)深度数理推导与工程落地解析
token-choice Top-k 最常见(token 选专家);expert-choice 让专家选 token(天然均衡);soft routing 全加权(失去稀疏优势)。
-
【AI 核心深度 M4-074】解释 MoE 的基本结构与稀疏激活。(Mixture of Experts (MoE) Architecture and Sparse Activation)深度数理推导与工程落地解析
把 FFN 换成 N 个专家,路由器为每个 token 选 Top-k 个专家计算;总参数大但每 token 激活量小。
-
【AI 核心深度 M4-075】解释 MoE 的负载均衡损失,为什么需要它。(Load Balancing Loss in MoE and Why Routing Collapse Occurs)深度数理推导与工程落地解析
路由器倾向只选少数专家(赢者通吃),导致专家利用不均、训练不稳;用辅助损失鼓励均匀分配。
-
【AI 核心深度 M4-076】解释 MoE 的通信挑战与专家并行。(Communication Bottlenecks and Expert Parallelism in MoE)深度数理推导与工程落地解析
专家分在不同设备上,token 需 all-to-all 发送到对应专家再取回;通信量与路由不均衡是主要开销。
-
【AI 核心深度 M4-077】比较稠密模型与 MoE 的推理特性。(Inference Characteristics: Dense Models vs. MoE)深度数理推导与工程落地解析
同激活参数下 MoE 质量更好但显存需求 ∝ 总参数、计算不规则;稠密模型显存小、计算规则、吞吐更优。