模型融合:模型合并与进化式重组技术报告
Data Analytics report
参数空间合并、任务向量、子空间方法、进化搜索及其安全与工程边界;证据截至 2026-08-11。
证据截至 2026-08-11|技术受众|深度文献综述
技术摘要
本文把社区俗称的“模型交配”严格定义为:以两个或多个已训练 LLM 为父代,通过权重插值、任务向量算术、稀疏/符号消冲突、子空间分解、层/模块重组或进化搜索产生单一后代模型。它不等同于输出集成、知识蒸馏或传统 MoE;后者分别在预测、训练数据或运行时路由层面组合模型。
结论先行。 模型合并是真实有效、但条件性很强的后训练技术。最可靠的适用区间是:同一架构、同一 tokenizer、最好来自同一基础权重的 homologous checkpoints,且各父代微调更新处于相容的低损失区域。对这种情形,归一化 Task Arithmetic/线性平均应当是默认基线。TIES、DARE/DELLA、RegMean、SVD 子空间与进化式合并解决不同干扰源,但“方法更复杂”并不意味着在真实 checkpoint 目录中更稳健。
2026 年 TMLR 的系统研究在 4 个开放权重 LLM、每个 12 个真实微调 checkpoint、16 个基准上发现:在异质、目标可能重叠或冲突的“in-the-wild”设置中,只有 Task Arithmetic 随父代数增加稳定获得构成性干扰;复杂的干扰感知和子空间方法多数不优于基座。其平均提升仍较小,通常低于 1 个平均准确率点。这一结果是对早期小规模、任务清晰实验的关键修正,而不是对整个领域的否定。
2025–2026 年前沿已从“发明一种新的加权公式”转向五个方向:① 自动选择父代、算子和顺序;② 神经元/模块/层级细粒度重组;③ 多目标与质量—多样性进化;④ 跨语言、跨模态与动态路由;⑤ 把安全、许可和 IP 保护设为一等约束。工程上,“training-free”只表示不做梯度训练;父代筛选、系数搜索和完整评测仍可能成为主要成本。
最强的现实证据:简单方法在异质父代中反而更稳
下图复算自 2026 年 TMLR 论文 Table 1,纵轴是合并结果超过基础模型的组合比例,横轴是合并父代数量;每个点对 4 个模型家族取平均。Task Arithmetic 从 2 个父代时的 49% 上升至 6 个及以上的 100%,而 TIES 在 12 个父代时降至 75%。这支持一个更细的结论:异质更新的平均与抵消可能把模型留在基座附近的低损失盆地;TIES 的裁剪与符号共识会阻断部分抵消,反而放大不相干的高方差更新。
这不是“Task Arithmetic 永远最好”。该研究使用通用基准、固定工具链和随机父代子集,回答的是现实 checkpoint 重用问题;当父代任务明确分离、数据可用、或目标是 LoRA/多模态/安全约束时,其他方法仍可能占优。
基础模型家族
4Source: Hitit, Girrbach & Akata (TMLR 2026) — study design
Llama 与 Qwen,3B–8B
论文实验设计常量的可复现结构化转录。
每个 base 的父代
12Source: Hitit, Girrbach & Akata (TMLR 2026) — study design
每个基础模型的真实公开微调版本
论文实验设计常量的可复现结构化转录。
标准评测任务
16Source: Hitit, Girrbach & Akata (TMLR 2026) — study design
常识、科学问答与多步推理
论文实验设计常量的可复现结构化转录。
论文 Table 1 Average 行的逐值转录;未跨论文归一化。
| 合并父代数量 | 超过 base 的组合比例 | 合并方法 | 平均相对准确率增益 |
|---|---|---|---|
| 2 | 49% | Task Arithmetic | -0.02 |
| 4 | 88% | Task Arithmetic | 0.5 |
| 6 | 100% | Task Arithmetic | 0.74 |
| 8 | 100% | Task Arithmetic | 0.87 |
| 10 | 100% | Task Arithmetic | 0.93 |
| 12 | 100% | Task Arithmetic | 1.02 |
| 2 | 53% | Model Stock | 0.02 |
| 4 | 77% | Model Stock | 0.06 |
| 6 | 82% | Model Stock | 0.09 |
| 8 | 82% | Model Stock | 0.1 |
| 10 | 80% | Model Stock | 0.11 |
| 12 | 100% | Model Stock | 0.13 |
| 2 | 78% | TIES | 0.11 |
| 4 | 85% | TIES | 0.14 |
| 6 | 87% | TIES | 0.18 |
| 8 | 85% | TIES | 0.17 |
| 10 | 80% | TIES | 0.17 |
| 12 | 75% | TIES | 0.13 |
同一研究中的成功率与增益
论文 Table 1 Average 行的逐值转录;未跨论文归一化。
| 方法 | 父代数 | 成功率 (%) | 相对准确率增益 |
|---|---|---|---|
| Task Arithmetic | 2Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 49Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | -0.02Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Model Stock | 2Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 53Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.02Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| TIES | 2Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 78Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.11Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Task Arithmetic | 4Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 88Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.5Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Model Stock | 4Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 77Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.06Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| TIES | 4Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 85Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.14Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Task Arithmetic | 6Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 100Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.74Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Model Stock | 6Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 82Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.09Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| TIES | 6Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 87Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.18Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Task Arithmetic | 8Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 100Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.87Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Model Stock | 8Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 82Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.1Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| TIES | 8Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 85Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.17Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Task Arithmetic | 10Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 100Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.93Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| Model Stock | 10Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 80Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.11Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
| TIES | 10Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | 80Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row | +0.17Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row |
18 results · Showing first 15
术语与边界:究竟什么算“交配”
本报告纳入的对象
- 稠密权重合并:输出仍是一套与父代同规模的参数,例如 Linear、SLERP、Model Soup。
- 任务向量重组:令基础模型为 θ₀,父代为 θᵢ,任务向量 τᵢ = θᵢ − θ₀;后代为 θ* = θ₀ + λ·Σαᵢτᵢ。
- 干扰感知合并:对 τᵢ 做裁剪、掩码、符号决议、重要性加权或低秩分解。
- 结构重组:按层、注意力/MLP 模块或神经元选择父代;可保持原深度,也可能形成更深的“Frankenmerge”。
- 进化式模型重组:把父代选择、合并算子、层路由和系数编码为基因型,用 CMA-ES、质量—多样性、粒子群或其他黑盒优化搜索。
不应混为一谈
- Ensemble 同时运行多个模型并聚合 logits,推理成本随成员数增加;稠密合并通常保持单模型推理成本。
- Distillation 通过样本和梯度把教师行为训练进学生,可跨架构,但不是纯权重重组。
- MoE upcycling 保留多个专家并在运行时路由,参数量和系统复杂度增加;它是动态组合,不等价于压成一套稠密权重。
- Checkpoint averaging / EMA 合并同一训练轨迹的时间点,通常比跨任务父代更容易,因为参数对齐天然更好。
因此,“模型交配”是一个有用的形象说法,但技术报告中更准确的总称是 model merging / model composition / evolutionary model merging。
为什么权重算术有时成立:低损失连通、共同初始化与对称性
模型平均能工作并非因为神经网络整体是线性的,而是因为合并路径在某些局部区域近似保持低损失。Model Soups 观察到同一预训练模型的不同微调解常位于同一宽盆地;Task Arithmetic 进一步把微调差值解释为可加的行为方向。Fisher merging 把每个父代局部后验近似为高斯,以 Fisher 信息作为逐参数精度;RegMean 则让每个线性层的合并输出逼近父代输出。
三个前提决定了成功率:
- 共同坐标系:相同架构、张量形状和参数语义只是最低要求;共同初始化显著降低置换错位。独立训练模型即使功能相同,也可能因神经元置换、缩放和注意力对称性而处于不同坐标系。Git Re-Basin 说明先对齐再平均可恢复线性连通;2026 年关于神经元可识别性与十亿参数 Transformer 的研究继续把这一思路推向更大规模。
- 任务向量可组合性:若 τᵢ 近似正交或共享有益方向,平均可减少噪声并保留技能;若方向强冲突,直接求和会产生破坏性干扰。
- 离基座的距离受控:归一化和缩放 λ 决定后代离开 θ₀ 多远。TMLR 研究显示,异质任务向量的平均抵消让 Task Arithmetic 对常用 λ 区间较稳定;取消归一化后稳定性明显下降。
这里的理论仍是局部和近似的。低损失路径不保证生成行为、安全边界或长链推理保持不变;参数距离小也不等价于功能距离小。
方法谱系:每一类实际上在解决不同的冲突
| 方法族 | 代表方法 | 核心操作 | 数据需求 | 主要优势 | 典型失败模式 |
|---|---|---|---|---|---|
| 直接插值 | Linear、Model Soup、SLERP | θ* = Σwᵢθᵢ;SLERP 沿球面插值 | 无或少量验证集 | 最简单、便宜、强基线 | 父代未对齐或离得太远时跨越高损失区 |
| 任务向量 | Task Arithmetic | 合并 θᵢ−θ₀ 并缩放 | 可无数据 | 能加、减技能;2026 真实 checkpoint 研究中最稳 | 依赖共同 base;权重和 λ 仍需验证 |
| 稀疏与符号消冲突 | TIES、DARE、DELLA、Breadcrumbs | 裁剪小更新、丢弃/重标度、符号投票、幅值采样 | 通常无数据 | 降低冗余与显式符号冲突 | 稀疏化可能阻断有益抵消;随机性与密度敏感 |
| 重要性/回归 | Fisher、RegMean/RegMean++ | Fisher 精度加权或层输出最小二乘 | 需要校准数据或统计量 | 有概率/函数逼近解释 | 数据分布错配;逐层独立会忽略跨层传播 |
| 子空间与低秩 | KnOTS、TSV-M、Iso-C、No Task Left Behind | SVD 对齐、投影、分离公共/任务子空间 | 无或少量数据 | 尤其适合 LoRA 和结构化更新 | “任务子空间稳定”假设在异质 LLM checkpoint 上可能失效 |
| 层/模块/神经元 | layer swap、passthrough、MIN-Merging、MERGE | 选择或路由父代组件 | 无数据到少量探针 | 更细粒度、可跨语言/模态转移 | 接口分布失配;可能改变深度和推理成本 |
| 自动/进化搜索 | EvoMerge、MM-MO、CycleQD、MERGE³、PSO | 搜索父代、算子、顺序、系数和层路由 | 需要 fitness 数据 | 能处理多目标和离散组合空间 | 对评测集过拟合;每个候选都要加载/推理 |
一个常见误区是把 SLERP、TIES、DARE 当作同一层级的互斥选项。实际上 DARE/DELLA 是任务向量的预处理,常可与 Linear 或 TIES 组合;进化算法搜索的是“配方”,其底层算子仍可能是这些方法。
进化式“交配”:从手工配方到可搜索的模型谱系
EvoMerge 把合并形式化为黑盒优化。一个候选基因型可包含:父代集合 P、每层来源、任务向量权重 α、密度 d、合并顺序 π、tokenizer/头部选择以及数据流连接。解码后生成 θ(g),在验证任务上计算 fitness F(g),再做选择、交叉、变异与继承。参数空间搜索可用 CMA-ES;数据流空间搜索则决定层的拼接与路由。
前沿演化路线。 2024 年 Sakana AI 的 EvoMerge 同时搜索参数空间和数据流空间;ICLR 2025 的 CycleQD 用质量—多样性框架维护多个技能生态位,以模型合并作 crossover、SVD 扰动作 mutation;ICML 2025 的 MERGE³ 通过项目反应理论缩减 fitness 评测,报告将评测成本降低约 50 倍;2025 年的 Population-Based Evolution 明确引入 crossover、mutation、selection、succession,并在 Gemma-2-2B-IT 衍生父代上用每个新任务 200 个样本进行无梯度适配;2026 年继续出现 PSO-Merging、稀疏感知演化和可泛化黑盒优化器。
真正的瓶颈是 fitness,不是 crossover。 如果同一基准既指导搜索又报告结果,进化会直接“育种”出 benchmark specialist。可靠流程至少需要 search/selection/test 三层隔离、任务分层抽样、多随机种子、保留父代与基础模型对照,并把安全、延迟、内存和许可兼容性纳入多目标约束。MERGE³ 的意义正在于降低这一评测瓶颈,而不是证明廉价搜索已经没有过拟合风险。
多目标场景不应把所有指标粗暴加权成一个分数。MAP、MM-MO 和 CycleQD 的 Pareto/质量—多样性思想更适合保留“数学强、代码强、安全强”等不同后代,再由部署需求选择,而不是过早塌缩成单一平均模型。
2024–2026 前沿论文地图:从参数冲突走向可预测、细粒度与跨模态
已同行评审、优先阅读
- Evolutionary Optimization of Model Merging Recipes(Nature Machine Intelligence, 2025):自动搜索权重与层级数据流配方,是“进化式模型交配”的奠基工作。
- CycleQD(ICLR 2025 Poster):质量—多样性进化、merge crossover 与 SVD mutation,面向 agent 技能组合。
- MAP: Low-compute Model Merging with Amortized Pareto Fronts(ICLR 2025 Poster):以二次近似低成本刻画任务权衡的 Pareto 前沿。
- MERGE³(ICML 2025 Poster):用项目反应理论估计候选能力,降低进化式合并的 fitness 成本。
- No Task Left Behind(ICML 2025 Poster):分离任务矩阵的公共与任务特异子空间,覆盖全量微调和 LoRA。
- Layer Swapping for Zero-Shot Cross-Lingual Transfer(ICLR 2025 Spotlight):少量层交换把数学能力迁移到非英语语言,显示结构重组可胜于全参数搅拌。
- A Systematic Study of In-the-Wild Model Merging(TMLR 2026):目前最重要的反证式评测;Task Arithmetic 稳健,复杂方法在异质父代上普遍不占优。
- RegMean++(TMLR 2026):把层内与跨层依赖加入闭式回归合并,修正 RegMean 的逐层独立假设。
- MIN-Merging(ICLR 2026 Oral):用 router 选择重要神经元,强调 in-domain 增益与 OOD 保持。
- OptMerge(ICLR 2026 Poster):系统研究 MLLM 的能力与模态合并,并补足多模态合并基准。
高价值前沿信号,但需按预印本/投稿看待
- Nature-Inspired Population-Based Evolution of LLMs:把群体进化四操作完整化,报告在 12 个数据集上相对初始最佳父代最高提升 54.8%;结论依赖小模型父代与低样本任务设置。
- Merge Hijacking:表明恶意父代可让多种合并算法继承后门,同时维持表面效用。
- SimMerge:用少量无标签 probes 的结构与功能相似性预测算子和顺序,目标是替代昂贵 merge-and-evaluate。
- Fine-Grained MERGE:组件级、输入感知的按需重组,把静态合并推向模块化组合。
- Scaling Linear Mode Connectivity to Billion-Parameter Transformers:用保持功能的变换和双向学习寻找共享线性路径,为跨独立训练 LLM 合并提供更强理论/实验信号。
- Model Merging in the Era of LLMs:2026 年 FUSE 综述,适合用作最新 taxonomy 与生态索引,但不替代原始实验。
阅读时必须区分论文状态:同一时期的 ICLR/ACL 投稿中包含撤稿和未接收工作;“最新”不能自动等同于“最可信”。
可复现工程路线:先证明父代可合,再谈高级配方
1. 资格检查
先记录每个父代的 base lineage、架构、层数、hidden size、GQA/MHA 布局、RoPE 参数、词表与特殊 token、chat template、量化状态、许可证和已知安全评测。共享 base 的全量微调模型是首选;LoRA 需确认秩、target modules 和 scaling。不同 tokenizer 或输出头不能靠“同尺寸”掩盖语义错位。
2. 最小基线矩阵
至少评测:基础模型、每个父代、均匀 Linear、归一化 Task Arithmetic、SLERP(仅两父代)、TIES 与 DARE-TIES。LoRA 再加入 KnOTS;有校准数据再加入 Fisher/RegMean;只有在这些基线已显示可组合性时才投入进化搜索。使用 mergekit 可把方法、层切片、tokenizer 和 chat template 写成可审计 YAML。
3. 评测设计
- 能力保留:每个父代专长任务,报告相对父代 retained performance,而非只报平均分。
- 泛化:完全未用于调权或进化的 held-out tasks;最好包含分布外与不同提示模板。
- 对照:base、best parent、父代 ensemble 上界、可获得时的联合多任务 SFT。
- 稳健性:系数 λ、裁剪密度、父代顺序、父代子集与随机种子敏感性;报告 Pareto 前沿而非只报最优点。
- 生成与系统指标:指令遵循、长文本、代码执行、事实性、校准、吞吐、显存、首 token 延迟。
- 安全:越狱、毒性、隐私记忆、后门触发、拒答过度与安全回归。
4. 选择规则
如果简单平均或 Task Arithmetic 都不能在 held-out 集上超过 best parent,优先回到父代选择、共同 base、合并感知微调或蒸馏;不要用更大搜索预算掩盖坐标系不相容。若静态后代无法同时满足冲突目标,再考虑 router、latent merge 或 MoE,但要承认推理与运维成本已经改变。
安全、IP 与治理:后代会继承的不只是能力
安全不是可自动平均的属性。 EMNLP 2024 的 One Bad Model Spoils the Bunch 显示误对齐会随合并传播;SafeMERGE(2025)和 AlignMerge(2025 预印本)分别用选择性层合并和 Fisher 几何约束保护安全锚点。NeurIPS 2025 的 RESM 则把 helpfulness、honesty、harmlessness 显式作为平衡目标。结论是:安全模型不应只是众多父代之一,而应作为约束、锚点和独立验收门槛。
供应链攻击是现实威胁。 Merge Hijacking 构造恶意上传模型,使后代在多种算子下继承后门。应保存父代哈希与来源,隔离加载环境,执行静态权重异常检查、触发扫描和行为红队;陌生社区 checkpoint 不应直接进入自动进化池。
许可兼容性不能由 merge 工具替代。 合并结果通常会被上游许可证视为 derivative 或受类似义务约束;例如 Meta Llama 3 许可证要求分发时保留协议和归属,并限制用 Llama 材料改进其他非 Llama LLM。多父代许可的归属、用途限制、再分发和命名义务可能冲突。发布后代前应做逐父代 license BOM 和法律审查,本报告不构成法律意见。
IP 保护本身也进入攻防。 2024 年研究显示水印和指纹可能被合并削弱;2025–2026 年的 MergeLock、unmergeable 模型与 merge-adversarial watermarking 试图主动阻止未授权合并。由此可见,模型合并不仅是能力工程,也是一种模型供应链与权利管理操作。
局限性、证据不确定性与稳健性判断
- 跨论文数字不可直接横比。 论文使用不同模型家族、父代任务、提示模板、few-shot 设置、评测器和合并实现;本报告只对同一研究内部的数值作比较。
- 排行榜存在选择偏差。 社区通常只发布成功配方;大量失败 merge 不可见,导致成功率被高估。
- 平均基准掩盖父代技能丢失。 一个 merge 可能平均分提高,却在关键专业任务或安全行为上显著退化。
- “无训练”不是“无数据、无算力”。 数据无关算子仍需要选择 λ 和密度;自动搜索更需要反复推理。
- 理论多来自局部几何或较小模型。 线性 mode connectivity、Fisher/Laplace 与层级最小二乘提供解释,但不足以保证开放式生成行为。
- 2026 前沿成熟度不一。 本报告将正式发表结果与预印本/会议投稿分层;后者应视为待复现信号。
综合置信度:高——共同 base 与参数对齐是关键、必须强基线与独立测试、安全与许可需单独验收;中等——归一化 Task Arithmetic 是异质真实 checkpoint 的最佳默认起点;低到中等——当前进化式或细粒度方法能普遍超过精心设计的联合训练,因为证据仍高度依赖任务和搜索预算。
建议与研究议程
对实践团队
- 把模型合并定位为低成本假设生成与后训练组合工具,而不是训练的无条件替代品。
- 默认从“同 base + 归一化 Task Arithmetic + held-out 验证”开始;只有明确诊断出符号冲突、低秩错位或层级错配后,再选择 TIES/DARE、KnOTS、RegMean 或模块路由。
- 进化搜索应优化 Pareto 目标,并把 search、selection、test 严格隔离;fitness 中加入安全、延迟和许可可行性。
- 建立 model lineage/BOM:父代哈希、base、数据声明、许可证、合并 YAML、评测版本和所有失败候选都应留档。
最值得攻克的开放问题
- 能否在真正执行 merge 前,用廉价 probes 可靠预测“亲缘度”、最佳算子与顺序?SimMerge 和 model kinship 只是开端。
- 如何让微调过程生成天然可合并的任务向量,而不是事后修复冲突?
- 如何建立覆盖技能保留、安全漂移、后门与许可证的标准化 Model Merge Benchmark?
- 能否对开放式生成建立超越参数距离的功能连通理论与可验证保证?
- 静态稠密后代、动态 latent/router 组合与 MoE 之间,何处是能力—延迟—可控性的最优边界?
- 合并能否支持可逆更新、精确删除和持续学习,同时避免误差随世代累积?
本领域最可能的长期形态不是一种“万能交配公式”,而是一个分层编译器:先判断父代亲缘与许可,再选择对齐、稀疏、子空间或模块算子,最后以多目标验证把候选编译成可部署后代。
核心参考文献与资源
奠基与方法:Fisher-Weighted Averaging;Model Soups;Git Re-Basin;Task Arithmetic;TIES-Merging;DARE / Super Mario;Model Breadcrumbs;DELLA;KnOTS。
综述与工具:2024 综合综述;2026 FUSE 综述;MergeKit 论文;MergeKit 官方仓库;Sakana AI 技术报告。
安全与治理:One Bad Model Spoils the Bunch(EMNLP 2024);SafeMERGE;Merge Hijacking;Have You Merged My Model?;Meta Llama 3 License。
报告优先引用原始论文、正式会议记录、官方代码仓库与许可证原文;博客只用于生态与工具背景。
Sources
- Hitit, Girrbach & Akata (TMLR 2026) — study design
论文实验设计常量的可复现结构化转录。
SQL query
SELECT 4 AS base_models, 12 AS checkpoints_per_base, 16 AS benchmarks; - Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average row
论文 Table 1 Average 行的逐值转录;未跨论文归一化。
SQL query
SELECT * FROM (VALUES ('Task Arithmetic',2,49,-0.02),('Task Arithmetic',4,88,0.50),('Task Arithmetic',6,100,0.74),('Task Arithmetic',8,100,0.87),('Task Arithmetic',10,100,0.93),('Task Arithmetic',12,100,1.02),('Model Stock',2,53,0.02),('Model Stock',4,77,0.06),('Model Stock',6,82,0.09),('Model Stock',8,82,0.10),('Model Stock',10,80,0.11),('Model Stock',12,100,0.13),('TIES',2,78,0.11),('TIES',4,85,0.14),('TIES',6,87,0.18),('TIES',8,85,0.17),('TIES',10,80,0.17),('TIES',12,75,0.13)) AS t(method,n,success_probability,relative_gain);
如果这篇文章帮助到了你,你可以请作者喝一杯咖啡

浙公网安备 33010602011771号