Tag: talentme
-
【AI 工业核题 G2】LoRA 低秩矩阵微调(前向传播与权重合并)(LoRA (Low-Rank Adaptation))深度实现与原理解析
微软大模型高效微调工业标配,冻结预训练权重,利用低秩矩阵 A 和 B 注入旁路梯度增量。
-
【AI 工业核题 G1】Conv2d 卷积算子纯手写(四层循环实现)(Conv2d from Scratch with Stride & Padding)深度实现与原理解析
计算机视觉底层基石,纯手写前向滑动窗口,清晰展示输出尺寸公式、零填充与通道累加。
-
【AI 工业核题 F7】多臂老虎机探索策略(epsilon-Greedy 与 UCB1)(Multi-Armed Bandit: epsilon-Greedy & UCB1)深度实现与原理解析
强化学习与推荐系统探索/利用(Exploration vs Exploitation)核心算法,置信区间上界打分。
-
【AI 工业核题 F6】KL 散度与自适应惩罚项(前向 vs 逆向 KL)(KL Divergence & Adaptive Penalty)深度实现与原理解析
测量两个概率分布的距离,大模型对齐防止策略跑偏的核心约束惩罚项。
-
【AI 工业核题 F5】GAE(广义优势估计)(Generalized Advantage Estimation (GAE))深度实现与原理解析
通过指数加权移动平均在单步 TD 误差(低方差高偏差)与全蒙特卡洛回报(零偏差高方差)之间达成最优权衡。
-
【AI 工业核题 F4】GRPO 组内相对优势归一化(DeepSeek 核心免 Critic 架构)(Group Relative Policy Optimization (GRPO))深度实现与原理解析
DeepSeekMath / DeepSeek-R1 核心基石,彻底砍掉同等规模的 Critic 价值网络,组内自归一化节省 50% 显存。
-
【AI 工业核题 F3】PPO 裁剪代理目标损失(Clipped Surrogate Objective)(PPO Clipped Surrogate Objective Loss)深度实现与原理解析
OpenAI 强化学习基石,通过重要性采样概率比与 [1-eps, 1+eps] 截断防止策略单步更新步子迈太大崩盘。
-
【AI 工业核题 F2】DPO 直接偏好优化损失(免奖励模型对齐)(Direct Preference Optimization (DPO))深度实现与原理解析
斯坦福团队里程碑,彻底抛弃独立 Reward Model 与 PPO 采样,显式解析求解直接在策略网络上微调偏好。
-
【AI 工业核题 F1】Bradley-Terry 奖励模型损失(偏好对数似然)(Bradley-Terry Preference Reward Model Loss)深度实现与原理解析
InstructGPT / RLHF 奖励模型的核心训练目标,Chosen 胜过 Rejected 标量分差的 Sigmoid 交叉熵。
-
【AI 工业核题 E8】Huber Loss / Smooth L1(对异常点鲁棒的回归损失)(Huber Loss & Smooth L1 Loss)深度实现与原理解析
误差较小时采用 L2 平滑二次收敛,误差较大时切换为 L1 线性常数梯度,目标检测边界框回归标配。