Tag: science-coding
-
【AI 工业核题 G5】Pre-LN Transformer 残差块装配(完整层实现)(Pre-LN Transformer Residual Block Assembly)深度实现与原理解析
现代大模型标配层结构,将 LayerNorm/RMSNorm 置于注意力与 MLP 分支内部,主干保留无损纯净残差流。
-
【AI 工业核题 G4】adaLN-Zero(DiT 扩散模型条件注入)(adaLN-Zero (Adaptive LayerNorm with Zero Init))深度实现与原理解析
Sora / DiT 核心,基于时间步与标签条件动态生成缩放、平移与残差门控参数,全零初始化保证初始等价于恒等映射。
-
【AI 工业核题 G3】MoE Top-K 门控与负载均衡损失(MoE Top-K Routing & Auxiliary Load Balancing Loss)深度实现与原理解析
Mixtral / DeepSeek-V3 核心架构,稀疏门控路由分发,辅助负载均衡损失防止专家饿死坍塌。
-
【AI 工业核题 G2】LoRA 低秩矩阵微调(前向传播与权重合并)(LoRA (Low-Rank Adaptation))深度实现与原理解析
微软大模型高效微调工业标配,冻结预训练权重,利用低秩矩阵 A 和 B 注入旁路梯度增量。
-
【AI 工业核题 G1】Conv2d 卷积算子纯手写(四层循环实现)(Conv2d from Scratch with Stride & Padding)深度实现与原理解析
计算机视觉底层基石,纯手写前向滑动窗口,清晰展示输出尺寸公式、零填充与通道累加。
-
【AI 工业核题 F7】多臂老虎机探索策略(epsilon-Greedy 与 UCB1)(Multi-Armed Bandit: epsilon-Greedy & UCB1)深度实现与原理解析
强化学习与推荐系统探索/利用(Exploration vs Exploitation)核心算法,置信区间上界打分。
-
【AI 工业核题 F6】KL 散度与自适应惩罚项(前向 vs 逆向 KL)(KL Divergence & Adaptive Penalty)深度实现与原理解析
测量两个概率分布的距离,大模型对齐防止策略跑偏的核心约束惩罚项。
-
【AI 工业核题 F5】GAE(广义优势估计)(Generalized Advantage Estimation (GAE))深度实现与原理解析
通过指数加权移动平均在单步 TD 误差(低方差高偏差)与全蒙特卡洛回报(零偏差高方差)之间达成最优权衡。
-
【AI 工业核题 F4】GRPO 组内相对优势归一化(DeepSeek 核心免 Critic 架构)(Group Relative Policy Optimization (GRPO))深度实现与原理解析
DeepSeekMath / DeepSeek-R1 核心基石,彻底砍掉同等规模的 Critic 价值网络,组内自归一化节省 50% 显存。
-
【AI 工业核题 F3】PPO 裁剪代理目标损失(Clipped Surrogate Objective)(PPO Clipped Surrogate Objective Loss)深度实现与原理解析
OpenAI 强化学习基石,通过重要性采样概率比与 [1-eps, 1+eps] 截断防止策略单步更新步子迈太大崩盘。