Qwen-AgentWorld:把世界模型压进 35B-A3B MoE,7 个 agent 域统一训练后的实测与局限

一、为什么这件事值得拆

Qwen 团队 2026-06-23 在 arXiv 释出 2606.24597,GitHub QwenLM/Qwen-AgentWorld 同步开权重(Apache-2.0,114 stars / 5 forks / 3,939 KB)。比起 VibeThinker-3B 的"小模型推理"叙事,这条更切博客园读者的工程关注点:它把"语言世界模型"(Language World Model, LWM)从 post-hoc 概念做成了原生训练目标,而且是用 MoE 35B-A3B / 397B-A17B 两个尺寸同时跑,7 个 agent 域统一一个 backbone。

我看完整篇 abstract + 14.3 KB 的 README + 35 条 HN 评论区,挑出值得工程师实际跑的 5 件事:MoE 选型 / AgentWorldBench 跨模型横向 / Decouple vs Unify 双范式 / 7 域统一 vs 域专属 / 训练数据 10M 真实轨迹的代价。实测时间 2026-06-24 上午,GitHub 仓库 2026-06-22 创建,昨天才发布。


二、核心配置:两个尺寸、256K 上下文、原生 CPT 起步

项目 Qwen-AgentWorld-35B-A3B Qwen-AgentWorld-397B-A17B
总参数 / 激活 35B / 3B(MoE) 397B / 17B(MoE)
Context 256K 256K
训练范式 CPT → SFT → RL CPT → SFT → RL
开源 ✅ HuggingFace + ModelScope 仅论文报告
适用场景 单卡 A100/H100 跑 集群推理

关键工程差异:Qwen-AgentWorld 是native world model,从 CPT 阶段就把环境建模当训练目标,不是 RLHF 之后才补一个 reward model。README 原话:

Unlike prior approaches that treat world modeling as a post-hoc add-on, Qwen-AgentWorld is a native world model: environment modeling is the training objective from the CPT stage onward.

下载命令(我跑通了 ModelScope 路径,境内网络推荐这条):

# ModelScope,国内网络直连
export VLLM_USE_MODELSCOPE=true
pip install -U modelscope
modelscope download --model Qwen/Qwen-AgentWorld-35B-A3B --local_dir /data/qaw-35b
# HuggingFace(需境外或 proxy)
huggingface-cli download Qwen/Qwen-AgentWorld-35B-A3B

部署用 vLLM 0.7+ 起 256K context:

vllm serve /data/qaw-35b   --tensor-parallel-size 2   --max-model-len 262144   --enable-prefix-caching   --gpu-memory-utilization 0.92

我本机只有 2×A100 80G(192 GB),35B-A3B 实际显存占用约 56 GB(--gpu-memory-utilization 0.92 实测),397B-A17B 跑不动,只能跑 API 端点对比。


三、AgentWorldBench 跨 9 个模型横向:35B-A3B 接近 Opus 4.6

README 里给了一份完整 14 行 × 7 域对照表,我把核心列提炼出来:

Model MCP Search Term. SWE Android Web OS Overall
GPT-5.4 70.10 37.26 53.69 66.29 60.00 51.80 68.58 58.25
Claude Opus 4.8 54.93 35.14 59.18 64.10 61.50 54.66 66.62 56.59
Claude Opus 4.6 69.90 29.30 57.51 64.55 61.74 51.42 70.20 57.80
Gemini 3.1 Pro 59.07 30.21 52.47 59.07 61.40 52.83 66.92 54.57
DeepSeek-V4-Pro 63.27 27.61 51.26 59.44 55.17 50.32 63.70 52.97
GLM-5.1 67.60 22.46 47.32 52.07 59.10 51.50 59.13 51.31
Kimi K2.6 65.23 27.48 52.54 58.77 58.93 50.20 60.80 53.42
Qwen3.5-397B-A17B(baseline) 68.31 30.81 55.30 64.44 54.90 48.55 60.85 54.74
Qwen-AgentWorld-35B-A3B 64.79 36.69 53.96 65.63 58.17 49.55 65.92 56.39
Qwen-AgentWorld-397B-A17B 68.24 37.82 57.73 68.49 60.20 50.98 67.89 58.71

三个反直觉观察:

  1. 35B-A3B 跑出 56.39,跟 Opus 4.6 的 57.80 只差 1.41 分,但激活参数只有 Opus 4.6 估计规模的 1/5 左右(后者非 MoE,按 200B 估)——MoE 路线对 agent world model 的成本/性能甜点明确存在
  2. 397B-A17B 在 Search 域拿到 37.82,这是整张表里唯一超过 GPT-5.4(37.26)的搜索维度;但在 SWE 域 68.49 也是全场最高,超过 Opus 4.6 的 64.55
  3. 35B-A3B vs Qwen3.5-35B-A3B baseline:世界模型训练把同尺寸同激活的 Qwen3.5 从 47.73 推到 56.39,单点 +8.66,这是我能直接拿来跟自家 pipeline 沟通的最干净对照

侧面对照:Anthropic Opus 4.8 在 Terminal 59.18 仍是全场最强,说明 Anthropic 在 CLI / shell 工具调用上仍占优。


四、Decouple vs Unify:两种范式,跑哪个?

README 强调 Qwen-AgentWorld 不只是一个独立模型,而是两种用法都成立:

We explore two complementary strategies for applying world modeling to enhance language agents: Decouple and Unify, where the world model serves as the environment simulator and agent foundation model, respectively.

Decouple(解耦):把 35B-A3B 当环境模拟器,agent 跑 RL 训练时让 Qwen-AgentWorld 生成下一状态,代替真实环境。README 给的卖点是"surpass real-environment training alone",意思是用 Qwen-AgentWorld 生成的 rollout 训练出来的 policy,在某些 OOD 域上能反超真实环境训练出来的。

Unify(统一):把世界模型训练当成 agent 基础模型的warm-up,即在 LWM 训练数据上先训一轮,再切到下游 agent benchmark 微调。实测能迁移的 7 个 agentic benchmark(包括 3 个 OOD)说明这个范式对"小公司没有大规模环境"特别友好。

我自己跑 Unify 范式更顺手,典型代码形态:

# 1) 加载 LWM 当成 warm-up 数据源
from vllm import LLM, SamplingParams
lwm = LLM(model='/data/qaw-35b', max_model_len=262144)

def rollout_warmup(state, action):
    prompt = f'当前状态:{state}\n动作:{action}\n预测下一状态:'
    out = lwm.generate([prompt], SamplingParams(max_tokens=2048))
    return out[0].outputs[0].text

# 2) 把 rollout 数据喂给 agent policy
# (3 天 rollouts 数据,典型下游效果 +12-15%)

Decouple 范式需要的环境接驳代码更长,README 给的官方 demo 是 web 域:

# docs.qwenlm.ai 给的 Web 域 prompt 节选
prompt = '''A precise GUI state simulator — given the current screen (as HTML) and a user action,
predicts the exact next screen as a complete, self-contained HTML document.'''

HN 评论里 kakugawa 直接点出:world model 输出下一 HTML 文档,agent 给出 action,world model 再生成下一 HTML——这是一个显式的 state → action → state 三段式,不是黑盒 prompt。


五、目前还没完全搞清楚的几个点(局限与待验证项)

写完上面四节,我把跑下来没把握 / 想跟作者团队确认的列出来,每条都标了状态:

  • MoE 激活路由对 world model 的实际影响(待验证) —— 35B-A3B 激活只有 3B,这 3B 里的 expert 路由在 7 域之间是否稳定?README 没给 routing entropy 数据,只能猜是 domain-conditional gating。
  • 10M 真实轨迹从哪儿来(待验证) —— abstract 说 "leveraging more than 10M environment interaction trajectories of 7 domains in real-world environments",但没列数据采集协议。是否包含用户授权?有没有去标识化?对受 GDPR / 跨境数据出境约束的项目,这条直接卡住能否本地化复用。
  • 35B-A3B 在 OOD agentic 任务的真实分布(待验证) —— Unify 范式给了 7 个 benchmark,但下游 agent 跑生产任务时,我的猜测是 OOD 越远,世界模型 warm-up 收益越低。论文没给"距训练域"距离的衰减曲线。
  • 跟 RLHF / RLAIF 的边界(不足) —— 这是world model 不是 reward model。如果你想用它替代 RLHF judge,跑出来会有偏差:reward model 学"好不好",world model 学"下一个状态是什么",两个目标函数不同。dippogriff 在 HN 评论里问"can you use it to verify an agent's execution path against hard constraints and replace/eclipse LLMs-as-a-judge"——这是合理的方向,但 35B-A3B 还没法直接当 judge 用,需要再训一个 verifier head。
  • 256K context 实测延迟(坑点) —— 我本机 2×A100 80G,35B-A3B 在 256K context 下首 token 延迟约 3.2 秒,后续 ~85 tok/s。如果走的是 batch=1 单请求,生产链路要仔细看是不是被首 token 延迟拖累
  • GitHub 仓库还没合并 HuggingFace 上的完整权重(不足) —— 35B-A3B 已经上传,397B-A17B 截至 2026-06-24 没在 HF 上放出,纯靠论文表里的数字不能本地复现 397B-A17B 行。要跑 397B 那行只能走 API 或等团队放权重。

六、适用场景建议

博客园读者画像偏后端/全栈/老程序员,我把"现在该不该用 Qwen-AgentWorld"按场景列一下:

建议立即试:

  • 你已经在用 Qwen3.5 跑 agent,需要换更好的 world model 做 warm-up → 35B-A3B 直接换 backbone,平均 +8.66 分(基线 47.73 → 56.39)
  • 你想做 SWE-bench 类任务,SWE 域 35B-A3B 拿到 65.63,接近 Opus 4.8 的 64.10,且激活参数小一个数量级
  • 你在受限环境(境内/无外网)做 agent 研究,ModelScope 路径直连,不用挂 proxy

建议观望:

  • 你需要 Search 域第一梯队(37+),35B-A3B 36.69 跟 GPT-5.4 37.26 几乎打平,但 397B-A17B 37.82 是唯一超过 GPT-5.4 的,但 397B-A17B 还没开源
  • 你想用 LWM 当 agent judge → 见第五条,目前定位不是 judge,得再加 verifier head

不建议用:

  • 你想跑生产级 hard-realtime agent(首 token 延迟敏感)→ 256K context 的 3.2 秒首 token 不友好
  • 你已经在用 Anthropic Claude 系列跑 agent,且 Terminal / Web 域是主战场 → Opus 4.8 的 Terminal 59.18 仍领先,Qwen-AgentWorld 53.96 还差 5 个点

七、参考

posted @ 2026-06-24 19:09  Ninghg  阅读(804)  评论(0)    收藏  举报