Tag: learning-rate-schedules
-
【AI 核心深度 M3-040】为什么需要 warmup?(Why Learning Rate Warmup is Necessary in Deep Learning)深度数理推导与工程落地解析
初始参数与随机初始化下梯度方向噪声大、Adam 二阶矩估计不可靠;warmup 用小 lr 让统计量收敛,避免早期发散。
-
【AI 核心深度 M3-041】比较 cosine、step、linear、WSD 调度(Comparing Learning Rate Schedules: Cosine, Step, Linear, and WSD)深度数理推导与工程落地解析
cosine 平滑衰减到 0、step 分段下降、linear 线性衰减、WSD 先稳定后快速衰减;LLM 主流是 cosine 或 WSD。
-
【AI 核心深度 M3-042】学习率与 batch size 的关系是什么?线性缩放规则(Relationship Between Learning Rate and Batch Size: Linear vs Square-Root Scaling)深度数理推导与工程落地解析
lr 与 batch 近似成正比(线性缩放);但超过临界 batch 后收益饱和,改用 sqrt 缩放。
-
【AI 核心深度 M3-043】解释学习率预热的另一种动机:Adam 的二阶矩偏差(Alternative Motivation for Warmup: Adam’s Second-Moment Variance Collapse)深度数理推导与工程落地解析
Adam 的 v 是平方梯度的 EWMA,初期低估真实二阶矩,使有效步长偏大;warmup 等 v 收敛后再放大 lr。
-
【AI 核心深度 M3-044】如何诊断学习率是否合适?(How to Diagnose Learning Rate Suitability: Signals, Metrics, and LR Range Tests)深度数理推导与工程落地解析
看 loss 曲线形态与梯度范数:lr 过大 → loss 震荡/爆炸;过小 → 下降缓慢且后期停滞;用 lr range test 定范围。
-
【AI 核心深度 M3-045】解释 WSD(warmup-stable-decay)调度为什么适合大模型预训练(Why Warmup-Stable-Decay (WSD) is Ideal for Large Language Model Pre-training)深度数理推导与工程落地解析
warmup 升温、stable 段恒定高 lr 长期探索、decay 段快速退火;stable 段可随时中断续训,decay 决定最终质量。
-
【AI 核心深度 M3-046】解释 One-Cycle / 循环学习率策略(The One-Cycle Policy and Cyclical Learning Rates: Mechanisms and Super-Convergence)深度数理推导与工程落地解析
让 lr 在一个周期内先升后降(呈三角/余弦),配合动量反向变化;可大幅缩短训练时间并提升精度。