Tag: tokenization-bpe-wordpiece-unigram
-
【AI 核心深度 M5-001】解释 BPE 算法,并说明它为什么被广泛使用。(BPE Algorithm and Why It Is Widely Used in LLMs)深度数理推导与工程落地解析
从字符开始,反复合并最高频的相邻符号对,直到达到目标词表;兼顾高频词整体化与未登录词可分解。
-
【AI 核心深度 M5-002】比较 BPE、WordPiece 与 Unigram。(Comparison of BPE, WordPiece, and Unigram Tokenization)深度数理推导与工程落地解析
BPE 按频次合并;WordPiece 按’似然增益’合并(BERT);Unigram 从大词表出发按概率剪枝(T5/SentencePiece)。
-
【AI 核心深度 M5-003】解释词表大小对模型的影响与取舍。(Vocabulary Size Trade-offs in LLMs)深度数理推导与工程落地解析
词表大 → 序列短(推理省)但 embedding/softmax 参数多;词表小 → 参数少但序列长;经验值 32k~128k。
-
【AI 核心深度 M5-004】解释 tokenizer 对下游指标的影响,为什么跨模型比较 PPL 不公平。(Impact of Tokenizer on Downstream Metrics and Why Cross-Model Perplexity (PPL) Comparisons Are Unfair)深度数理推导与工程落地解析
PPL 是’每 token 的困惑度’,与分词粒度强相关;不同 tokenizer 的 PPL 不可直接比较,需按’每字节’归一化。
-
【AI 核心深度 M5-005】解释分词对多语言与代码的影响与常见问题。(Tokenizer Challenges in Multilingual and Code Domains)深度数理推导与工程落地解析
非拉丁语言 fertility 高(中文常 1~2 字/token)、代码缩进与符号被切碎、数字切分不规则损害算术。
-
【AI 核心深度 M5-006】解释词表扩展(vocabulary expansion)的做法与注意点。(Vocabulary Expansion Techniques and Considerations)深度数理推导与工程落地解析
为新语言/领域追加 token 并初始化其 embedding,再继续训练;注意初始化方式、学习率与对原能力的保护。