Fork me on GitHub

模型融合:模型合并与进化式重组技术报告

Data Analytics report

参数空间合并、任务向量、子空间方法、进化搜索及其安全与工程边界;证据截至 2026-08-11。

证据截至 2026-08-11|技术受众|深度文献综述

技术摘要

本文把社区俗称的“模型交配”严格定义为:以两个或多个已训练 LLM 为父代,通过权重插值、任务向量算术、稀疏/符号消冲突、子空间分解、层/模块重组或进化搜索产生单一后代模型。它不等同于输出集成、知识蒸馏或传统 MoE;后者分别在预测、训练数据或运行时路由层面组合模型。

结论先行。 模型合并是真实有效、但条件性很强的后训练技术。最可靠的适用区间是:同一架构、同一 tokenizer、最好来自同一基础权重的 homologous checkpoints,且各父代微调更新处于相容的低损失区域。对这种情形,归一化 Task Arithmetic/线性平均应当是默认基线。TIES、DARE/DELLA、RegMean、SVD 子空间与进化式合并解决不同干扰源,但“方法更复杂”并不意味着在真实 checkpoint 目录中更稳健。

2026 年 TMLR 的系统研究在 4 个开放权重 LLM、每个 12 个真实微调 checkpoint、16 个基准上发现:在异质、目标可能重叠或冲突的“in-the-wild”设置中,只有 Task Arithmetic 随父代数增加稳定获得构成性干扰;复杂的干扰感知和子空间方法多数不优于基座。其平均提升仍较小,通常低于 1 个平均准确率点。这一结果是对早期小规模、任务清晰实验的关键修正,而不是对整个领域的否定。

2025–2026 年前沿已从“发明一种新的加权公式”转向五个方向:① 自动选择父代、算子和顺序;② 神经元/模块/层级细粒度重组;③ 多目标与质量—多样性进化;④ 跨语言、跨模态与动态路由;⑤ 把安全、许可和 IP 保护设为一等约束。工程上,“training-free”只表示不做梯度训练;父代筛选、系数搜索和完整评测仍可能成为主要成本。

最强的现实证据:简单方法在异质父代中反而更稳

下图复算自 2026 年 TMLR 论文 Table 1,纵轴是合并结果超过基础模型的组合比例,横轴是合并父代数量;每个点对 4 个模型家族取平均。Task Arithmetic 从 2 个父代时的 49% 上升至 6 个及以上的 100%,而 TIES 在 12 个父代时降至 75%。这支持一个更细的结论:异质更新的平均与抵消可能把模型留在基座附近的低损失盆地;TIES 的裁剪与符号共识会阻断部分抵消,反而放大不相干的高方差更新。

这不是“Task Arithmetic 永远最好”。该研究使用通用基准、固定工具链和随机父代子集,回答的是现实 checkpoint 重用问题;当父代任务明确分离、数据可用、或目标是 LoRA/多模态/安全约束时,其他方法仍可能占优。

基础模型家族

4Source: Hitit, Girrbach & Akata (TMLR 2026) — study designTable: Paper methods and Section 3.3

Llama 与 Qwen,3B–8B

Llama 与 Qwen,3B–8BSource: Hitit, Girrbach & Akata (TMLR 2026) — study designTable: Paper methods and Section 3.3

论文实验设计常量的可复现结构化转录。

每个 base 的父代

12Source: Hitit, Girrbach & Akata (TMLR 2026) — study designTable: Paper methods and Section 3.3

每个基础模型的真实公开微调版本

每个基础模型的真实公开微调版本Source: Hitit, Girrbach & Akata (TMLR 2026) — study designTable: Paper methods and Section 3.3

论文实验设计常量的可复现结构化转录。

标准评测任务

16Source: Hitit, Girrbach & Akata (TMLR 2026) — study designTable: Paper methods and Section 3.3

常识、科学问答与多步推理

常识、科学问答与多步推理Source: Hitit, Girrbach & Akata (TMLR 2026) — study designTable: Paper methods and Section 3.3

论文实验设计常量的可复现结构化转录。

异质父代越多,Task Arithmetic 的成功概率越稳定
异质父代越多,Task Arithmetic 的成功概率越稳定 data
合并父代数量超过 base 的组合比例合并方法平均相对准确率增益
249%Task Arithmetic-0.02
488%Task Arithmetic0.5
6100%Task Arithmetic0.74
8100%Task Arithmetic0.87
10100%Task Arithmetic0.93
12100%Task Arithmetic1.02
253%Model Stock0.02
477%Model Stock0.06
682%Model Stock0.09
882%Model Stock0.1
1080%Model Stock0.11
12100%Model Stock0.13
278%TIES0.11
485%TIES0.14
687%TIES0.18
885%TIES0.17
1080%TIES0.17
1275%TIES0.13

同一研究中的成功率与增益

Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row

论文 Table 1 Average 行的逐值转录;未跨论文归一化。

同一研究中的成功率与增益
方法父代数成功率 (%)相对准确率增益
Task Arithmetic2Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row49Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row-0.02Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Model Stock2Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row53Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.02Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
TIES2Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row78Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.11Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Task Arithmetic4Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row88Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.5Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Model Stock4Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row77Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.06Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
TIES4Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row85Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.14Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Task Arithmetic6Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row100Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.74Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Model Stock6Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row82Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.09Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
TIES6Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row87Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.18Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Task Arithmetic8Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row100Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.87Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Model Stock8Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row82Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.1Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
TIES8Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row85Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.17Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Task Arithmetic10Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row100Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.93Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
Model Stock10Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row80Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.11Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row
TIES10Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row80Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row+0.17Source: Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowTable: Paper Table 1, Average row

18 results · Showing first 15

术语与边界:究竟什么算“交配”

本报告纳入的对象

  • 稠密权重合并:输出仍是一套与父代同规模的参数,例如 Linear、SLERP、Model Soup。
  • 任务向量重组:令基础模型为 θ₀,父代为 θᵢ,任务向量 τᵢ = θᵢ − θ₀;后代为 θ* = θ₀ + λ·Σαᵢτᵢ。
  • 干扰感知合并:对 τᵢ 做裁剪、掩码、符号决议、重要性加权或低秩分解。
  • 结构重组:按层、注意力/MLP 模块或神经元选择父代;可保持原深度,也可能形成更深的“Frankenmerge”。
  • 进化式模型重组:把父代选择、合并算子、层路由和系数编码为基因型,用 CMA-ES、质量—多样性、粒子群或其他黑盒优化搜索。

不应混为一谈

  • Ensemble 同时运行多个模型并聚合 logits,推理成本随成员数增加;稠密合并通常保持单模型推理成本。
  • Distillation 通过样本和梯度把教师行为训练进学生,可跨架构,但不是纯权重重组。
  • MoE upcycling 保留多个专家并在运行时路由,参数量和系统复杂度增加;它是动态组合,不等价于压成一套稠密权重。
  • Checkpoint averaging / EMA 合并同一训练轨迹的时间点,通常比跨任务父代更容易,因为参数对齐天然更好。

因此,“模型交配”是一个有用的形象说法,但技术报告中更准确的总称是 model merging / model composition / evolutionary model merging

为什么权重算术有时成立:低损失连通、共同初始化与对称性

模型平均能工作并非因为神经网络整体是线性的,而是因为合并路径在某些局部区域近似保持低损失。Model Soups 观察到同一预训练模型的不同微调解常位于同一宽盆地;Task Arithmetic 进一步把微调差值解释为可加的行为方向。Fisher merging 把每个父代局部后验近似为高斯,以 Fisher 信息作为逐参数精度;RegMean 则让每个线性层的合并输出逼近父代输出。

三个前提决定了成功率:

  1. 共同坐标系:相同架构、张量形状和参数语义只是最低要求;共同初始化显著降低置换错位。独立训练模型即使功能相同,也可能因神经元置换、缩放和注意力对称性而处于不同坐标系。Git Re-Basin 说明先对齐再平均可恢复线性连通;2026 年关于神经元可识别性与十亿参数 Transformer 的研究继续把这一思路推向更大规模。
  2. 任务向量可组合性:若 τᵢ 近似正交或共享有益方向,平均可减少噪声并保留技能;若方向强冲突,直接求和会产生破坏性干扰。
  3. 离基座的距离受控:归一化和缩放 λ 决定后代离开 θ₀ 多远。TMLR 研究显示,异质任务向量的平均抵消让 Task Arithmetic 对常用 λ 区间较稳定;取消归一化后稳定性明显下降。

这里的理论仍是局部和近似的。低损失路径不保证生成行为、安全边界或长链推理保持不变;参数距离小也不等价于功能距离小。

方法谱系:每一类实际上在解决不同的冲突

方法族 代表方法 核心操作 数据需求 主要优势 典型失败模式
直接插值 Linear、Model Soup、SLERP θ* = Σwᵢθᵢ;SLERP 沿球面插值 无或少量验证集 最简单、便宜、强基线 父代未对齐或离得太远时跨越高损失区
任务向量 Task Arithmetic 合并 θᵢ−θ₀ 并缩放 可无数据 能加、减技能;2026 真实 checkpoint 研究中最稳 依赖共同 base;权重和 λ 仍需验证
稀疏与符号消冲突 TIES、DARE、DELLA、Breadcrumbs 裁剪小更新、丢弃/重标度、符号投票、幅值采样 通常无数据 降低冗余与显式符号冲突 稀疏化可能阻断有益抵消;随机性与密度敏感
重要性/回归 Fisher、RegMean/RegMean++ Fisher 精度加权或层输出最小二乘 需要校准数据或统计量 有概率/函数逼近解释 数据分布错配;逐层独立会忽略跨层传播
子空间与低秩 KnOTS、TSV-M、Iso-C、No Task Left Behind SVD 对齐、投影、分离公共/任务子空间 无或少量数据 尤其适合 LoRA 和结构化更新 “任务子空间稳定”假设在异质 LLM checkpoint 上可能失效
层/模块/神经元 layer swap、passthrough、MIN-Merging、MERGE 选择或路由父代组件 无数据到少量探针 更细粒度、可跨语言/模态转移 接口分布失配;可能改变深度和推理成本
自动/进化搜索 EvoMerge、MM-MO、CycleQD、MERGE³、PSO 搜索父代、算子、顺序、系数和层路由 需要 fitness 数据 能处理多目标和离散组合空间 对评测集过拟合;每个候选都要加载/推理

一个常见误区是把 SLERP、TIES、DARE 当作同一层级的互斥选项。实际上 DARE/DELLA 是任务向量的预处理,常可与 Linear 或 TIES 组合;进化算法搜索的是“配方”,其底层算子仍可能是这些方法。

进化式“交配”:从手工配方到可搜索的模型谱系

EvoMerge 把合并形式化为黑盒优化。一个候选基因型可包含:父代集合 P、每层来源、任务向量权重 α、密度 d、合并顺序 π、tokenizer/头部选择以及数据流连接。解码后生成 θ(g),在验证任务上计算 fitness F(g),再做选择、交叉、变异与继承。参数空间搜索可用 CMA-ES;数据流空间搜索则决定层的拼接与路由。

前沿演化路线。 2024 年 Sakana AI 的 EvoMerge 同时搜索参数空间和数据流空间;ICLR 2025 的 CycleQD 用质量—多样性框架维护多个技能生态位,以模型合并作 crossover、SVD 扰动作 mutation;ICML 2025 的 MERGE³ 通过项目反应理论缩减 fitness 评测,报告将评测成本降低约 50 倍;2025 年的 Population-Based Evolution 明确引入 crossover、mutation、selection、succession,并在 Gemma-2-2B-IT 衍生父代上用每个新任务 200 个样本进行无梯度适配;2026 年继续出现 PSO-Merging、稀疏感知演化和可泛化黑盒优化器。

真正的瓶颈是 fitness,不是 crossover。 如果同一基准既指导搜索又报告结果,进化会直接“育种”出 benchmark specialist。可靠流程至少需要 search/selection/test 三层隔离、任务分层抽样、多随机种子、保留父代与基础模型对照,并把安全、延迟、内存和许可兼容性纳入多目标约束。MERGE³ 的意义正在于降低这一评测瓶颈,而不是证明廉价搜索已经没有过拟合风险。

多目标场景不应把所有指标粗暴加权成一个分数。MAP、MM-MO 和 CycleQD 的 Pareto/质量—多样性思想更适合保留“数学强、代码强、安全强”等不同后代,再由部署需求选择,而不是过早塌缩成单一平均模型。

2024–2026 前沿论文地图:从参数冲突走向可预测、细粒度与跨模态

已同行评审、优先阅读

  • Evolutionary Optimization of Model Merging Recipes(Nature Machine Intelligence, 2025):自动搜索权重与层级数据流配方,是“进化式模型交配”的奠基工作。
  • CycleQD(ICLR 2025 Poster):质量—多样性进化、merge crossover 与 SVD mutation,面向 agent 技能组合。
  • MAP: Low-compute Model Merging with Amortized Pareto Fronts(ICLR 2025 Poster):以二次近似低成本刻画任务权衡的 Pareto 前沿。
  • MERGE³(ICML 2025 Poster):用项目反应理论估计候选能力,降低进化式合并的 fitness 成本。
  • No Task Left Behind(ICML 2025 Poster):分离任务矩阵的公共与任务特异子空间,覆盖全量微调和 LoRA。
  • Layer Swapping for Zero-Shot Cross-Lingual Transfer(ICLR 2025 Spotlight):少量层交换把数学能力迁移到非英语语言,显示结构重组可胜于全参数搅拌。
  • A Systematic Study of In-the-Wild Model Merging(TMLR 2026):目前最重要的反证式评测;Task Arithmetic 稳健,复杂方法在异质父代上普遍不占优。
  • RegMean++(TMLR 2026):把层内与跨层依赖加入闭式回归合并,修正 RegMean 的逐层独立假设。
  • MIN-Merging(ICLR 2026 Oral):用 router 选择重要神经元,强调 in-domain 增益与 OOD 保持。
  • OptMerge(ICLR 2026 Poster):系统研究 MLLM 的能力与模态合并,并补足多模态合并基准。

高价值前沿信号,但需按预印本/投稿看待

阅读时必须区分论文状态:同一时期的 ICLR/ACL 投稿中包含撤稿和未接收工作;“最新”不能自动等同于“最可信”。

可复现工程路线:先证明父代可合,再谈高级配方

1. 资格检查

先记录每个父代的 base lineage、架构、层数、hidden size、GQA/MHA 布局、RoPE 参数、词表与特殊 token、chat template、量化状态、许可证和已知安全评测。共享 base 的全量微调模型是首选;LoRA 需确认秩、target modules 和 scaling。不同 tokenizer 或输出头不能靠“同尺寸”掩盖语义错位。

2. 最小基线矩阵

至少评测:基础模型、每个父代、均匀 Linear、归一化 Task Arithmetic、SLERP(仅两父代)、TIES 与 DARE-TIES。LoRA 再加入 KnOTS;有校准数据再加入 Fisher/RegMean;只有在这些基线已显示可组合性时才投入进化搜索。使用 mergekit 可把方法、层切片、tokenizer 和 chat template 写成可审计 YAML。

3. 评测设计

  • 能力保留:每个父代专长任务,报告相对父代 retained performance,而非只报平均分。
  • 泛化:完全未用于调权或进化的 held-out tasks;最好包含分布外与不同提示模板。
  • 对照:base、best parent、父代 ensemble 上界、可获得时的联合多任务 SFT。
  • 稳健性:系数 λ、裁剪密度、父代顺序、父代子集与随机种子敏感性;报告 Pareto 前沿而非只报最优点。
  • 生成与系统指标:指令遵循、长文本、代码执行、事实性、校准、吞吐、显存、首 token 延迟。
  • 安全:越狱、毒性、隐私记忆、后门触发、拒答过度与安全回归。

4. 选择规则

如果简单平均或 Task Arithmetic 都不能在 held-out 集上超过 best parent,优先回到父代选择、共同 base、合并感知微调或蒸馏;不要用更大搜索预算掩盖坐标系不相容。若静态后代无法同时满足冲突目标,再考虑 router、latent merge 或 MoE,但要承认推理与运维成本已经改变。

安全、IP 与治理:后代会继承的不只是能力

安全不是可自动平均的属性。 EMNLP 2024 的 One Bad Model Spoils the Bunch 显示误对齐会随合并传播;SafeMERGE(2025)和 AlignMerge(2025 预印本)分别用选择性层合并和 Fisher 几何约束保护安全锚点。NeurIPS 2025 的 RESM 则把 helpfulness、honesty、harmlessness 显式作为平衡目标。结论是:安全模型不应只是众多父代之一,而应作为约束、锚点和独立验收门槛。

供应链攻击是现实威胁。 Merge Hijacking 构造恶意上传模型,使后代在多种算子下继承后门。应保存父代哈希与来源,隔离加载环境,执行静态权重异常检查、触发扫描和行为红队;陌生社区 checkpoint 不应直接进入自动进化池。

许可兼容性不能由 merge 工具替代。 合并结果通常会被上游许可证视为 derivative 或受类似义务约束;例如 Meta Llama 3 许可证要求分发时保留协议和归属,并限制用 Llama 材料改进其他非 Llama LLM。多父代许可的归属、用途限制、再分发和命名义务可能冲突。发布后代前应做逐父代 license BOM 和法律审查,本报告不构成法律意见。

IP 保护本身也进入攻防。 2024 年研究显示水印和指纹可能被合并削弱;2025–2026 年的 MergeLock、unmergeable 模型与 merge-adversarial watermarking 试图主动阻止未授权合并。由此可见,模型合并不仅是能力工程,也是一种模型供应链与权利管理操作。

局限性、证据不确定性与稳健性判断

  1. 跨论文数字不可直接横比。 论文使用不同模型家族、父代任务、提示模板、few-shot 设置、评测器和合并实现;本报告只对同一研究内部的数值作比较。
  2. 排行榜存在选择偏差。 社区通常只发布成功配方;大量失败 merge 不可见,导致成功率被高估。
  3. 平均基准掩盖父代技能丢失。 一个 merge 可能平均分提高,却在关键专业任务或安全行为上显著退化。
  4. “无训练”不是“无数据、无算力”。 数据无关算子仍需要选择 λ 和密度;自动搜索更需要反复推理。
  5. 理论多来自局部几何或较小模型。 线性 mode connectivity、Fisher/Laplace 与层级最小二乘提供解释,但不足以保证开放式生成行为。
  6. 2026 前沿成熟度不一。 本报告将正式发表结果与预印本/会议投稿分层;后者应视为待复现信号。

综合置信度:——共同 base 与参数对齐是关键、必须强基线与独立测试、安全与许可需单独验收;中等——归一化 Task Arithmetic 是异质真实 checkpoint 的最佳默认起点;低到中等——当前进化式或细粒度方法能普遍超过精心设计的联合训练,因为证据仍高度依赖任务和搜索预算。

建议与研究议程

对实践团队

  • 把模型合并定位为低成本假设生成与后训练组合工具,而不是训练的无条件替代品。
  • 默认从“同 base + 归一化 Task Arithmetic + held-out 验证”开始;只有明确诊断出符号冲突、低秩错位或层级错配后,再选择 TIES/DARE、KnOTS、RegMean 或模块路由。
  • 进化搜索应优化 Pareto 目标,并把 search、selection、test 严格隔离;fitness 中加入安全、延迟和许可可行性。
  • 建立 model lineage/BOM:父代哈希、base、数据声明、许可证、合并 YAML、评测版本和所有失败候选都应留档。

最值得攻克的开放问题

  1. 能否在真正执行 merge 前,用廉价 probes 可靠预测“亲缘度”、最佳算子与顺序?SimMerge 和 model kinship 只是开端。
  2. 如何让微调过程生成天然可合并的任务向量,而不是事后修复冲突?
  3. 如何建立覆盖技能保留、安全漂移、后门与许可证的标准化 Model Merge Benchmark?
  4. 能否对开放式生成建立超越参数距离的功能连通理论与可验证保证?
  5. 静态稠密后代、动态 latent/router 组合与 MoE 之间,何处是能力—延迟—可控性的最优边界?
  6. 合并能否支持可逆更新、精确删除和持续学习,同时避免误差随世代累积?

本领域最可能的长期形态不是一种“万能交配公式”,而是一个分层编译器:先判断父代亲缘与许可,再选择对齐、稀疏、子空间或模块算子,最后以多目标验证把候选编译成可部署后代。

核心参考文献与资源

奠基与方法Fisher-Weighted AveragingModel SoupsGit Re-BasinTask ArithmeticTIES-MergingDARE / Super MarioModel BreadcrumbsDELLAKnOTS

综述与工具2024 综合综述2026 FUSE 综述MergeKit 论文MergeKit 官方仓库Sakana AI 技术报告

安全与治理One Bad Model Spoils the Bunch(EMNLP 2024)SafeMERGEMerge HijackingHave You Merged My Model?Meta Llama 3 License

报告优先引用原始论文、正式会议记录、官方代码仓库与许可证原文;博客只用于生态与工具背景。

Sources

  1. Hitit, Girrbach & Akata (TMLR 2026) — study designANSI SQL

    论文实验设计常量的可复现结构化转录。

    SQL query
    SELECT 4 AS base_models, 12 AS checkpoints_per_base, 16 AS benchmarks;
  2. Hitit, Girrbach & Akata (TMLR 2026) — Table 1 Average rowDuckDB

    论文 Table 1 Average 行的逐值转录;未跨论文归一化。

    SQL query
    SELECT * FROM (VALUES ('Task Arithmetic',2,49,-0.02),('Task Arithmetic',4,88,0.50),('Task Arithmetic',6,100,0.74),('Task Arithmetic',8,100,0.87),('Task Arithmetic',10,100,0.93),('Task Arithmetic',12,100,1.02),('Model Stock',2,53,0.02),('Model Stock',4,77,0.06),('Model Stock',6,82,0.09),('Model Stock',8,82,0.10),('Model Stock',10,80,0.11),('Model Stock',12,100,0.13),('TIES',2,78,0.11),('TIES',4,85,0.14),('TIES',6,87,0.18),('TIES',8,85,0.17),('TIES',10,80,0.17),('TIES',12,75,0.13)) AS t(method,n,success_probability,relative_gain);
posted @ 2026-08-11 17:13  stardsd  阅读(12)  评论(0)    收藏  举报