Tag: science-depth
-
【AI 核心深度 M5-002】比较 BPE、WordPiece 与 Unigram。(Comparison of BPE, WordPiece, and Unigram Tokenization)深度数理推导与工程落地解析
BPE 按频次合并;WordPiece 按’似然增益’合并(BERT);Unigram 从大词表出发按概率剪枝(T5/SentencePiece)。
-
【AI 核心深度 M5-003】解释词表大小对模型的影响与取舍。(Vocabulary Size Trade-offs in LLMs)深度数理推导与工程落地解析
词表大 → 序列短(推理省)但 embedding/softmax 参数多;词表小 → 参数少但序列长;经验值 32k~128k。
-
【AI 核心深度 M5-004】解释 tokenizer 对下游指标的影响,为什么跨模型比较 PPL 不公平。(Impact of Tokenizer on Downstream Metrics and Why Cross-Model Perplexity (PPL) Comparisons Are Unfair)深度数理推导与工程落地解析
PPL 是’每 token 的困惑度’,与分词粒度强相关;不同 tokenizer 的 PPL 不可直接比较,需按’每字节’归一化。
-
【AI 核心深度 M5-005】解释分词对多语言与代码的影响与常见问题。(Tokenizer Challenges in Multilingual and Code Domains)深度数理推导与工程落地解析
非拉丁语言 fertility 高(中文常 1~2 字/token)、代码缩进与符号被切碎、数字切分不规则损害算术。
-
【AI 核心深度 M5-006】解释词表扩展(vocabulary expansion)的做法与注意点。(Vocabulary Expansion Techniques and Considerations)深度数理推导与工程落地解析
为新语言/领域追加 token 并初始化其 embedding,再继续训练;注意初始化方式、学习率与对原能力的保护。
-
【AI 核心深度 M5-007】解释因果语言建模(CLM)与掩码语言建模(MLM)的差异。(Causal Language Modeling (CLM) vs. Masked Language Modeling (MLM))深度数理推导与工程落地解析
CLM 预测下一个 token(因果 mask,可生成);MLM 随机掩码预测被掩位置(双向,不能直接生成)。
-
【AI 核心深度 M4-106】解释对称量化与非对称量化的差异。(Symmetric vs. Asymmetric Quantization Formulation and Overhead)深度数理推导与工程落地解析
对称量化以 0 为原点(zero_point=0,只有 scale);非对称量化用 (scale, zero_point) 映射任意区间 [min,max]。
-
【AI 核心深度 M4-107】解释 NF4 与 INT4 的差异。(Differences Between NormalFloat4 (NF4) and INT4 in QLoRA)深度数理推导与工程落地解析
INT4 是均匀整数格点;NF4 是’信息论最优’的非均匀格点(按正态分位数分布),更适合权重的高斯分布。
-
【AI 核心深度 M4-108】解释 W8A8 与 W4A16 的差异与取舍。(Weight-Activation Quantization Trade-offs: W8A8 vs. W4A16)深度数理推导与工程落地解析
W8A8 同时量化权重与激活(速度最快但激活难量化);W4A16 只量化权重到 4-bit(精度最稳、显存省 4 倍)。
-
【AI 核心深度 M4-109】解释 KV Cache 量化的收益与风险。(Benefits, Risks, and Outlier Sensitivity in KV Cache Quantization)深度数理推导与工程落地解析
KV cache 是长上下文显存大头;量化到 INT8/INT4 可省 2~4 倍,但 KV 动态且离群方向不同(K per-channel、V per-token)。