Tag: model-merging-distillation
-
【AI 核心深度 M5-124】解释任务算术(task arithmetic)与模型合并。(Task Arithmetic and Weight Space Model Merging)深度数理推导与工程落地解析
微调得到的’任务向量’(微调权重 − 基座权重)可加减组合,实现多任务能力的合并或去除。
-
【AI 核心深度 M5-125】解释 TIES 与 DARE 的核心思想。(Core Principles of TIES-Merging and DARE in Model Merging)深度数理推导与工程落地解析
TIES:修剪小值 + 符号一致时合并 + 按符号选多数,缓解干扰;DARE:随机丢弃增量并重缩放,减少冗余与冲突。
-
【AI 核心深度 M5-126】解释多 LoRA 服务与适配器合并的差异。(Multi-LoRA Serving vs. Static Weight Merging)深度数理推导与工程落地解析
多 LoRA 服务:同一基座 + 动态加载不同适配器(省显存、可热切换);合并:把适配器烘焙进权重(推理无开销、但不可切换)。
-
【AI 核心深度 M5-127】解释蒸馏中的容量差距与数据量需求。(Capacity Gap and Data Scaling Laws in LLM Distillation)深度数理推导与工程落地解析
学生容量远小于教师时,硬拟合教师分布困难(容量差距);需足够数据与合适温度,或分阶段蒸馏。
-
【AI 核心深度 M5-128】解释模型合并与集成的差异。(Model Merging vs. Ensemble Inference: Mechanics and Trade-offs)深度数理推导与工程落地解析
合并:参数层面合为一个模型(推理成本不变);集成:保留多个模型在预测层面平均(更稳但成本 ×N)。
-
【AI 核心深度 M5-129】解释合并方法的评估与风险。(Evaluation Methodologies and Safety Risks in Model Merging)深度数理推导与工程落地解析
需在多任务上分别评估(防’此消彼长’)、验证无能力退化、注意基座一致性与版本管理。