Tag: architecture
-
【AI 工业核题 G6】ViT Patch Embedding(图片切片投影与序列化)(Vision Transformer (ViT) Patch Embedding)深度实现与原理解析
An Image is Worth 16×16 Words 原理,将 2D 图像划分为小切片并展平成 1D Token 序列,单次卷积等价实现。
-
【AI 工业核题 G5】Pre-LN Transformer 残差块装配(完整层实现)(Pre-LN Transformer Residual Block Assembly)深度实现与原理解析
现代大模型标配层结构,将 LayerNorm/RMSNorm 置于注意力与 MLP 分支内部,主干保留无损纯净残差流。
-
【AI 工业核题 G3】MoE Top-K 门控与负载均衡损失(MoE Top-K Routing & Auxiliary Load Balancing Loss)深度实现与原理解析
Mixtral / DeepSeek-V3 核心架构,稀疏门控路由分发,辅助负载均衡损失防止专家饿死坍塌。
-
【AI 工业核题 G2】LoRA 低秩矩阵微调(前向传播与权重合并)(LoRA (Low-Rank Adaptation))深度实现与原理解析
微软大模型高效微调工业标配,冻结预训练权重,利用低秩矩阵 A 和 B 注入旁路梯度增量。
-
【AI 工业核题 G1】Conv2d 卷积算子纯手写(四层循环实现)(Conv2d from Scratch with Stride & Padding)深度实现与原理解析
计算机视觉底层基石,纯手写前向滑动窗口,清晰展示输出尺寸公式、零填充与通道累加。
-
Vector DB 向量数据库全景:HNSW 图索引、IVF-PQ 乘积量化与 ANN 相似度检索原理解构
> **核心摘要**:随着 Embedding 模型的普及,高维海量向量检索成为了大模型 RAG 与推荐系统的基石。传统暴力遍历 (FLAT) 检索复杂度为 $O(N cdot D)$,在数十亿规模向量下无法做到毫秒级响应。**向量数据库 (Vector DB)** 通过 **ANN (Approximate Nea
-
猜想解码 (Speculative Decoding) 全景:Draft Model 小模型草稿、拒绝采样证明与端侧加速
> **核心摘要**:大语言模型在生成阶段逐 Token 自回归预测,每次前向传播都要将数十吉字节的模型权重从 HBM 加载到 GPU 芯片上,算术强度仅为 $O(1)$ FLOPs/Byte(内存带宽极度受限)。**Speculative Decoding (猜想解码)** 引入一个极其轻量的 Draft Model
-
序列模型演进全景:RNN 随时间反向传播 (BPTT)、LSTM/GRU 门控机制、xLSTM 矩阵内存、HiPPO 矩阵与 Mamba 选择性状态空间模型 (S6) 极客指南
> **核心摘要**:处理变长序列与捕捉时间长程依赖是自然语言处理、语音识别与时序预测的核心课题。从早期的循环神经网络 (RNN)、解决梯度消失的门控机制 (LSTM / GRU),到近年重新焕发生机的 xLSTM,再到突破 Transformer $mathcal{O}(N^2)$ 复杂度与 KV Cache 显存
-
推理大模型与慢思考全景:DeepSeek-R1 纯 RL 自进化、Aha Moment 顿悟、长 CoT 蒸馏与 OpenAI o1/o3 慢思考范式
> **核心摘要**:传统的直觉式生成模型(System 1 / Fast Thinking)倾向于依赖模式匹配单向输出答案,在复杂数学、代码推导与逻辑解密中极易出现逻辑断层。**推理大模型 (Reasoning LLMs / System 2 Slow-Thinking)** 通过引入**长思维链 (Long Cha
-
支持向量机 (SVM):最大间隔几何推导、对偶变换、KKT 条件与高斯 RBF 核技巧全解
> **核心摘要**:支持向量机 (Support Vector Machine, SVM) 是经典统计学习中最具数学美感的分类算法之一。本指南系统化剖析从线性可分几何间隔最大化到软间隔松弛变量、拉格朗日对偶极值转换、KKT 条件下支持向量的稀疏性特征,再到高维核技巧 (Kernel Trick) 的映射原理与选型策略