Tag: science-depth
-
【AI 核心深度 M4-081】解释状态空间模型(SSM)的基本形式。(Fundamental Formulation of State Space Models (SSM))深度数理推导与工程落地解析
用线性递归 h'(t)=Ah(t)+Bx(t)、y=Ch(t) 描述序列;离散化后用卷积或扫描并行计算,复杂度线性。
-
【AI 核心深度 M4-082】解释 Mamba 的选择性机制(selective SSM)。(Selective State Space Models (Selective SSM) in Mamba)深度数理推导与工程落地解析
让 B、C、Δ 依赖输入(时变),使模型能’选择性’记忆或忽略信息;代价是无法用卷积,改用并行扫描。
-
【AI 核心深度 M4-083】比较 SSM 与注意力的复杂度与能力。(Complexity and Expressive Capability: SSM vs. Self-Attention)深度数理推导与工程落地解析
训练:注意力 O(L²) vs SSM O(L);推理:注意力每步 O(L)(KV)vs SSM O(1)(状态);能力:注意力可精确检索,SSM 是压缩记忆。
-
【AI 核心深度 M4-084】解释混合架构(Attention + SSM)的设计动机。(Design Motivations for Hybrid Architectures Combining Attention and SSM)深度数理推导与工程落地解析
用少量注意力层提供精确检索能力,大量 SSM/线性层提供线性复杂度,兼得能力与效率。
-
【AI 核心深度 M4-085】解释 Mamba 的硬件感知实现(并行扫描 + 核融合)。(Mamba Hardware-Aware Implementation: Parallel Scan and Kernel Fusion)深度数理推导与工程落地解析
把离散化、选择性扫描、输出投影融合进一个 kernel,中间数据留在 SRAM,避免 HBM 往返(同 Flash Attention 思想)。
-
【AI 核心深度 M4-086】SSM 的初始化与数值稳定性有什么特殊之处?(SSM Initialization and Numerical Stability: HiPPO Matrix and Discretization Precision)深度数理推导与工程落地解析
A 的初始化决定记忆特性(HiPPO/S4D 用特定结构);离散化 exp(ΔA) 易溢出,需参数化约束(如 A 用负实部)。
-
【AI 核心深度 M4-087】解释 GNN 的消息传递框架。(Message Passing Neural Network (MPNN) Framework in GNNs)深度数理推导与工程落地解析
每层分三步:邻居发消息(message)、聚合(aggregate,置换不变)、更新自身(update);堆叠 L 层即聚合 L 跳邻域。
-
【AI 核心深度 M4-088】比较 GCN、GraphSAGE 与 GAT。(Comparison of Graph Convolutional Networks: GCN, GraphSAGE, and GAT)深度数理推导与工程落地解析
GCN 用归一化的固定权重平均;GraphSAGE 采样邻居并学习聚合(可归纳);GAT 用注意力学习邻居权重。
-
【AI 核心深度 M4-089】解释 GNN 的过平滑与过挤压问题。(Oversmoothing and Oversquashing in Deep GNNs)深度数理推导与工程落地解析
过平滑:层数增加使节点表示趋同;过挤压:远距离信息需挤过瓶颈节点,导致长程依赖丢失。
-
【AI 核心深度 M4-090】解释 GNN 在大规模图上的训练策略。(Large-Scale Graph Training Strategies: Node Sampling, Layer Sampling, and Subgraph Partitioning)深度数理推导与工程落地解析
邻居采样(GraphSAGE/邻居爆炸)、子图采样(Cluster-GCN)、以及分布式训练与图分区。