Tag: architecture
-
Optimization & Matrix Calculus: Lagrange Multipliers, KKT Conditions, SVD & Convergence Geometry
> **Core Executive Summary**: Every machine learning model—from SVM geometric margin maximization to Transformer gradient descent updates—is fundamentally an **
-
World Models & JEPA: Yann LeCun’s Non-Generative Prediction, I-JEPA/V-JEPA & Embodied AI (VLA)
> **Core Executive Summary**: Turing Award winner Yann LeCun proposed **JEPA (Joint Embedding Predictive Architecture)**, advocating abandoning pixel-level reco
-
Multimodal Generative System Design: Image/Video Generation & GPU Scaling
> **Core Executive Summary**: Multimodal generative workloads — text-to-image, text-to-video, and vision-language understanding — are the most compute-hungry an
-
AIE 实战指南:企业级 SFT、LoRA 微调与 DPO/RLHF 偏好对齐落地
> **核心摘要**:大模型微调与对齐是 AI 工程师(AIE)将开源基座模型落地为垂类业务专家的核心技能。在工业实践中,微调面临三大挑战:训练数据长短不一导致 Padding 算力巨大浪费、显存不足导致全量微调代价高昂、以及强化学习对齐训练极度不稳定。本指南系统剖析 Data Packing 算法、Loss Mask
-
MLE 数据与特征工程:质量管线、编码策略、不平衡处理、特征选择与漂移检测全景
> **核心摘要**:模型的性能在训练开始之前就已注定——它由数据质量与特征工程决定。本指南覆盖 MLE 数据管线的完整闭环:数据质量四大威胁(漏标、噪声、重复、异常值)与清洗管线、缺失值填充策略对比、类别特征编码(Label / One-Hot / Target / OOF / Embedding)与防泄漏、数值特征
-
Agent 设计模式全景:ReAct 循环、Reflexion 自我反思、Plan-and-Execute 与 LangGraph 图工程
> **核心摘要**:大语言模型(LLM)不仅能作为无状态的问答工具,更能进化为具备自主决策能力的 **AI Agent (智能体)**。Agent 通过四大支柱——**Brain (大脑推理)**、**Planning (规划解构)**、**Memory (长短期记忆)** 和 **Tools (工具调用)**,能够
-
GPU 硬件架构全景:SM 流处理器、Tensor Core 混合精度、HBM 带宽与 Roofline 模型
> **核心摘要**:大模型训练与推理的高效落地极度依赖于底层 GPU 硬件的物理特性。NVIDIA H100 / A100 等 Modern GPU 拥有由数十个 **SM (Streaming Multiprocessor)** 组成的超大规模并行架构,并配备 **Tensor Cores** 与 3TB/s+ 吞
-
深度学习调试与竞赛工程全景:4 步调试框架、单 Batch 过拟合验证、数值梯度检查、20大常见工程Bug、Grad-CAM 可解释性与架构归纳偏置选型指南
> **核心摘要**:深度学习算法在工程落地与 Kaggle/KDD 竞赛中面临的最大挑战,往往不是网络结构的设计,而是漫长而痛苦的“模型调试 (Model Debugging)”过程。深度学习模型的隐蔽性极高——代码即使存在严重的逻辑 Bug(如 Data Leakage、Double Softmax、忘记清空梯度、
-
开源与商业 SOTA 大模型演进全景:从 BERT/GPT-4 到 LLaMA-3、Qwen-3、Gemma-4 与 Kimi-K2 架构对比
> **核心摘要**:自 Transformer 论文问世以来,大语言模型 (LLM) 经历了从早期单向/双向编码器(BERT/GPT-1/2)到大规模自回归生成,再到现代高并发 MoE 稀疏激活与长链慢思考的巨幅跨越。本指南系统解构**商业闭源顶级模型**(GPT-4/4o, Claude 4, Gemini 2.0
-
无监督聚类与 KNN:K-Means++ 坐标下降、DBSCAN 密度聚类、GMM 期望最大化 (EM) 与 KD-Tree 极客指南
> **核心摘要**:聚类与最近邻算法是模式识别与表征学习的基础。本指南系统梳理基于距离的 K-Means 算法及其坐标下降收敛机制、解决局部最优的 K-Means++ 初始化,基于密度的 DBSCAN 任意形状聚类,以概率建模为核心的 GMM 与 EM 算法严密数学推导,以及 KNN 算法中的维数灾难与 KD-Tre