AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M5-009】解释数据去重的方法与它为什么重要。(Data Deduplication Methods and Why It Matters in LLM Pre-training)深度数理推导与工程落地解析
精确去重(哈希)与近似去重(MinHash/LSH、SimHash);去重防止记忆、减少评测污染、提升训练效率。
【AI 核心深度 M5-010】解释课程学习与数据排序对训练的作用。(Curriculum Learning and Data Ordering in LLM Pre-training)深度数理推导与工程落地解析
按’由易到难’或’由通用到专业’排序数据可提升收敛与最终质量;但结论不稳健,需谨慎验证。
【AI 核心深度 M5-011】解释合成数据在预训练/后训练中的作用与风险。(Synthetic Data in Pre-training and Post-Training: Roles and Risks)深度数理推导与工程落地解析
用强模型/规则生成数据(教科书式、指令、CoT);可补齐稀缺能力,但有分布偏移、同质化与’模型坍缩’风险。
【AI 核心深度 M5-012】解释数据污染(contamination)与它对评测可信度的影响。(Data Contamination and Its Impact on Benchmark Reliability)深度数理推导与工程落地解析
测试集内容出现在训练数据中使评测虚高;需 n-gram 重叠检测、成员推断、以及新测试集验证。
【AI 核心深度 M5-013】解释预训练数据的领域配比与退火阶段(annealing)的作用。(Pre-training Domain Mixtures and the Role of the Annealing Phase)深度数理推导与工程落地解析
领域配比决定能力分布;退火阶段在训练末尾用高质量/领域数据并降 lr,低成本地强化目标能力。
【AI 核心深度 M5-014】写出 Kaplan 与 Chinchilla 的核心结论。(Core Conclusions of Kaplan vs. Chinchilla Scaling Laws)深度数理推导与工程落地解析
Kaplan:损失随参数量/数据/算力幂律下降,参数优先;Chinchilla:参数量与数据量应同比例增长(约 20 token/参数)。
【AI 核心深度 M5-015】解释为什么推理成本改变了 scaling 的取舍。(Why Inference Costs Alter Compute-Optimal Scaling Choices)深度数理推导与工程落地解析
Chinchilla 只优化训练算力;若推理量大,’更多数据训练更小模型’(over-training)可降低总拥有成本。
【AI 核心深度 M5-016】解释涌现能力(emergence)与它的争议。(Emergent Abilities in Large Language Models and the Metric Discontinuity Debate)深度数理推导与工程落地解析
某些能力在小模型上接近随机、超过某规模后突然出现;但争议认为这是’指标不连续’造成的假象。
【AI 核心深度 M5-017】解释数据受限下的 scaling 策略。(Scaling Strategies Under Data-Constrained Regimes)深度数理推导与工程落地解析
高质量数据耗尽时,幂律失效;对策是数据高效方法(更好架构/优化)、合成数据、多轮 epoch 与退火。
【AI 核心深度 M5-018】解释 scaling law 对超参与架构选择的指导意义。(Guiding Hyperparameter and Architecture Choices via Scaling Laws)深度数理推导与工程落地解析
用小型实验拟合幂律预测大规模表现,指导 N/D 配比与超参(μP 使超参可迁移);但不能外推到新机制。
【AI 核心深度 M5-019】解释后训练阶段的 scaling(RL/推理算力)与预训练 scaling 的差异。(Post-Training Scaling (RL and Test-Time Compute) vs. Pre-Training Scaling)深度数理推导与工程落地解析
预训练 scaling 平滑可预测;RL/后训练的 scaling 更不稳定、更依赖任务与数据,且常呈’先快后慢’。
【AI 核心深度 M5-020】解释 SFT 的目标与数据构造要点。(Supervised Fine-Tuning (SFT) Objectives and Data Construction Principles)深度数理推导与工程落地解析
SFT 用(指令,回答)对做监督微调,教会模型’按指令作答’的格式与风格;数据需多样、高质量、格式一致。
【AI 核心深度 M5-021】解释损失掩码与序列打包(packing)的作用。(Loss Masking and Sequence Packing in SFT Training)深度数理推导与工程落地解析
损失掩码让损失只算在回答上;打包把多条短样本拼成定长序列以提高利用率,需用注意力隔离防跨样本泄漏。
【AI 核心深度 M5-022】解释 SFT 中的灾难性遗忘与缓解。(Catastrophic Forgetting in SFT and Mitigation Strategies)深度数理推导与工程落地解析
SFT 在小数据上微调会损害预训练的通用能力;用低 lr、少 epoch、混合通用数据、LoRA/正则缓解。
【AI 核心深度 M5-001】解释 BPE 算法,并说明它为什么被广泛使用。(BPE Algorithm and Why It Is Widely Used in LLMs)深度数理推导与工程落地解析
从字符开始,反复合并最高频的相邻符号对,直到达到目标词表;兼顾高频词整体化与未登录词可分解。