AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-002】比较 BPE、WordPiece 与 Unigram。(Comparison of BPE, WordPiece, and Unigram Tokenization)深度数理推导与工程落地解析
BPE 按频次合并;WordPiece 按’似然增益’合并(BERT);Unigram 从大词表出发按概率剪枝(T5/SentencePiece)。
【AI 核心深度 M5-003】解释词表大小对模型的影响与取舍。(Vocabulary Size Trade-offs in LLMs)深度数理推导与工程落地解析
词表大 → 序列短(推理省)但 embedding/softmax 参数多;词表小 → 参数少但序列长;经验值 32k~128k。
【AI 核心深度 M5-004】解释 tokenizer 对下游指标的影响,为什么跨模型比较 PPL 不公平。(Impact of Tokenizer on Downstream Metrics and Why Cross-Model Perplexity (PPL) Comparisons Are Unfair)深度数理推导与工程落地解析
PPL 是’每 token 的困惑度’,与分词粒度强相关;不同 tokenizer 的 PPL 不可直接比较,需按’每字节’归一化。
【AI 核心深度 M5-005】解释分词对多语言与代码的影响与常见问题。(Tokenizer Challenges in Multilingual and Code Domains)深度数理推导与工程落地解析
非拉丁语言 fertility 高(中文常 1~2 字/token)、代码缩进与符号被切碎、数字切分不规则损害算术。
【AI 核心深度 M5-006】解释词表扩展(vocabulary expansion)的做法与注意点。(Vocabulary Expansion Techniques and Considerations)深度数理推导与工程落地解析
为新语言/领域追加 token 并初始化其 embedding,再继续训练;注意初始化方式、学习率与对原能力的保护。
【AI 核心深度 M5-007】解释因果语言建模(CLM)与掩码语言建模(MLM)的差异。(Causal Language Modeling (CLM) vs. Masked Language Modeling (MLM))深度数理推导与工程落地解析
CLM 预测下一个 token(因果 mask,可生成);MLM 随机掩码预测被掩位置(双向,不能直接生成)。
【AI 核心深度 M4-106】解释对称量化与非对称量化的差异。(Symmetric vs. Asymmetric Quantization Formulation and Overhead)深度数理推导与工程落地解析
对称量化以 0 为原点(zero_point=0,只有 scale);非对称量化用 (scale, zero_point) 映射任意区间 [min,max]。
【AI 核心深度 M4-107】解释 NF4 与 INT4 的差异。(Differences Between NormalFloat4 (NF4) and INT4 in QLoRA)深度数理推导与工程落地解析
INT4 是均匀整数格点;NF4 是’信息论最优’的非均匀格点(按正态分位数分布),更适合权重的高斯分布。
【AI 核心深度 M4-108】解释 W8A8 与 W4A16 的差异与取舍。(Weight-Activation Quantization Trade-offs: W8A8 vs. W4A16)深度数理推导与工程落地解析
W8A8 同时量化权重与激活(速度最快但激活难量化);W4A16 只量化权重到 4-bit(精度最稳、显存省 4 倍)。
【AI 核心深度 M4-109】解释 KV Cache 量化的收益与风险。(Benefits, Risks, and Outlier Sensitivity in KV Cache Quantization)深度数理推导与工程落地解析
KV cache 是长上下文显存大头;量化到 INT8/INT4 可省 2~4 倍,但 KV 动态且离群方向不同(K per-channel、V per-token)。
【AI 核心深度 M4-110】解释批处理、内核融合与算子优化对推理吞吐的影响。(Impact of Batching, Kernel Fusion, and Operator Optimization on Serving Throughput)深度数理推导与工程落地解析
批处理摊薄权重读取(memory-bound 的关键);融合减少中间张量读写;算子优化(如 Flash)提升单算子效率。
【AI 核心深度 M4-111】如何系统评估一次推理优化的收益?(Systematic Metric Framework for Evaluating Inference Optimizations: TTFT, TPOT, MFU, and Cost)深度数理推导与工程落地解析
先定位瓶颈(roofline + profiling),再测端到端指标(TTFT/TPOT/吞吐/goodput)与质量(任务指标),并做消融与稳定性验证。
【AI 核心深度 M4-112】解释 GPTQ / AWQ / SmoothQuant 三种量化算法的差异。(Comparison of Post-Training Quantization Algorithms: GPTQ, AWQ, and SmoothQuant)深度数理推导与工程落地解析
GPTQ 用二阶(Hessian)逐层最小化量化误差;AWQ 保护激活感知的显著通道;SmoothQuant 把激活难度转移到权重。
【AI 核心深度 M4-092】解释图神经网络与 Transformer 的关系。(Relationship Between Graph Neural Networks and Transformers)深度数理推导与工程落地解析
Transformer 是全连接图上的注意力 GNN;GNN 是稀疏图上固定/学习权重的注意力;Graph Transformer 用注意力 + 结构编码。
【AI 核心深度 M4-093】对比 RNN、CNN、Transformer 在序列建模上的归纳偏置。(Inductive Biases in Sequence Modeling: RNN, CNN, and Transformer)深度数理推导与工程落地解析
RNN 有序列递归偏置(顺序、可变长);CNN 有局部性/平移等变偏置;Transformer 偏置最弱(需数据学结构)。