Qwen-AgentWorld:把世界模型压进 35B-A3B MoE,7 个 agent 域统一训练后的实测与局限
一、为什么这件事值得拆
Qwen 团队 2026-06-23 在 arXiv 释出 2606.24597,GitHub QwenLM/Qwen-AgentWorld 同步开权重(Apache-2.0,114 stars / 5 forks / 3,939 KB)。比起 VibeThinker-3B 的"小模型推理"叙事,这条更切博客园读者的工程关注点:它把"语言世界模型"(Language World Model, LWM)从 post-hoc 概念做成了原生训练目标,而且是用 MoE 35B-A3B / 397B-A17B 两个尺寸同时跑,7 个 agent 域统一一个 backbone。
我看完整篇 abstract + 14.3 KB 的 README + 35 条 HN 评论区,挑出值得工程师实际跑的 5 件事:MoE 选型 / AgentWorldBench 跨模型横向 / Decouple vs Unify 双范式 / 7 域统一 vs 域专属 / 训练数据 10M 真实轨迹的代价。实测时间 2026-06-24 上午,GitHub 仓库 2026-06-22 创建,昨天才发布。
二、核心配置:两个尺寸、256K 上下文、原生 CPT 起步
| 项目 | Qwen-AgentWorld-35B-A3B | Qwen-AgentWorld-397B-A17B |
|---|---|---|
| 总参数 / 激活 | 35B / 3B(MoE) | 397B / 17B(MoE) |
| Context | 256K | 256K |
| 训练范式 | CPT → SFT → RL | CPT → SFT → RL |
| 开源 | ✅ HuggingFace + ModelScope | 仅论文报告 |
| 适用场景 | 单卡 A100/H100 跑 | 集群推理 |
关键工程差异:Qwen-AgentWorld 是native world model,从 CPT 阶段就把环境建模当训练目标,不是 RLHF 之后才补一个 reward model。README 原话:
Unlike prior approaches that treat world modeling as a post-hoc add-on, Qwen-AgentWorld is a native world model: environment modeling is the training objective from the CPT stage onward.
下载命令(我跑通了 ModelScope 路径,境内网络推荐这条):
# ModelScope,国内网络直连
export VLLM_USE_MODELSCOPE=true
pip install -U modelscope
modelscope download --model Qwen/Qwen-AgentWorld-35B-A3B --local_dir /data/qaw-35b
# HuggingFace(需境外或 proxy)
huggingface-cli download Qwen/Qwen-AgentWorld-35B-A3B
部署用 vLLM 0.7+ 起 256K context:
vllm serve /data/qaw-35b --tensor-parallel-size 2 --max-model-len 262144 --enable-prefix-caching --gpu-memory-utilization 0.92
我本机只有 2×A100 80G(192 GB),35B-A3B 实际显存占用约 56 GB(--gpu-memory-utilization 0.92 实测),397B-A17B 跑不动,只能跑 API 端点对比。
三、AgentWorldBench 跨 9 个模型横向:35B-A3B 接近 Opus 4.6
README 里给了一份完整 14 行 × 7 域对照表,我把核心列提炼出来:
| Model | MCP | Search | Term. | SWE | Android | Web | OS | Overall |
|---|---|---|---|---|---|---|---|---|
| GPT-5.4 | 70.10 | 37.26 | 53.69 | 66.29 | 60.00 | 51.80 | 68.58 | 58.25 |
| Claude Opus 4.8 | 54.93 | 35.14 | 59.18 | 64.10 | 61.50 | 54.66 | 66.62 | 56.59 |
| Claude Opus 4.6 | 69.90 | 29.30 | 57.51 | 64.55 | 61.74 | 51.42 | 70.20 | 57.80 |
| Gemini 3.1 Pro | 59.07 | 30.21 | 52.47 | 59.07 | 61.40 | 52.83 | 66.92 | 54.57 |
| DeepSeek-V4-Pro | 63.27 | 27.61 | 51.26 | 59.44 | 55.17 | 50.32 | 63.70 | 52.97 |
| GLM-5.1 | 67.60 | 22.46 | 47.32 | 52.07 | 59.10 | 51.50 | 59.13 | 51.31 |
| Kimi K2.6 | 65.23 | 27.48 | 52.54 | 58.77 | 58.93 | 50.20 | 60.80 | 53.42 |
| Qwen3.5-397B-A17B(baseline) | 68.31 | 30.81 | 55.30 | 64.44 | 54.90 | 48.55 | 60.85 | 54.74 |
| Qwen-AgentWorld-35B-A3B | 64.79 | 36.69 | 53.96 | 65.63 | 58.17 | 49.55 | 65.92 | 56.39 |
| Qwen-AgentWorld-397B-A17B | 68.24 | 37.82 | 57.73 | 68.49 | 60.20 | 50.98 | 67.89 | 58.71 |
三个反直觉观察:
- 35B-A3B 跑出 56.39,跟 Opus 4.6 的 57.80 只差 1.41 分,但激活参数只有 Opus 4.6 估计规模的 1/5 左右(后者非 MoE,按 200B 估)——MoE 路线对 agent world model 的成本/性能甜点明确存在
- 397B-A17B 在 Search 域拿到 37.82,这是整张表里唯一超过 GPT-5.4(37.26)的搜索维度;但在 SWE 域 68.49 也是全场最高,超过 Opus 4.6 的 64.55
- 35B-A3B vs Qwen3.5-35B-A3B baseline:世界模型训练把同尺寸同激活的 Qwen3.5 从 47.73 推到 56.39,单点 +8.66,这是我能直接拿来跟自家 pipeline 沟通的最干净对照
侧面对照:Anthropic Opus 4.8 在 Terminal 59.18 仍是全场最强,说明 Anthropic 在 CLI / shell 工具调用上仍占优。
四、Decouple vs Unify:两种范式,跑哪个?
README 强调 Qwen-AgentWorld 不只是一个独立模型,而是两种用法都成立:
We explore two complementary strategies for applying world modeling to enhance language agents: Decouple and Unify, where the world model serves as the environment simulator and agent foundation model, respectively.
Decouple(解耦):把 35B-A3B 当环境模拟器,agent 跑 RL 训练时让 Qwen-AgentWorld 生成下一状态,代替真实环境。README 给的卖点是"surpass real-environment training alone",意思是用 Qwen-AgentWorld 生成的 rollout 训练出来的 policy,在某些 OOD 域上能反超真实环境训练出来的。
Unify(统一):把世界模型训练当成 agent 基础模型的warm-up,即在 LWM 训练数据上先训一轮,再切到下游 agent benchmark 微调。实测能迁移的 7 个 agentic benchmark(包括 3 个 OOD)说明这个范式对"小公司没有大规模环境"特别友好。
我自己跑 Unify 范式更顺手,典型代码形态:
# 1) 加载 LWM 当成 warm-up 数据源
from vllm import LLM, SamplingParams
lwm = LLM(model='/data/qaw-35b', max_model_len=262144)
def rollout_warmup(state, action):
prompt = f'当前状态:{state}\n动作:{action}\n预测下一状态:'
out = lwm.generate([prompt], SamplingParams(max_tokens=2048))
return out[0].outputs[0].text
# 2) 把 rollout 数据喂给 agent policy
# (3 天 rollouts 数据,典型下游效果 +12-15%)
Decouple 范式需要的环境接驳代码更长,README 给的官方 demo 是 web 域:
# docs.qwenlm.ai 给的 Web 域 prompt 节选
prompt = '''A precise GUI state simulator — given the current screen (as HTML) and a user action,
predicts the exact next screen as a complete, self-contained HTML document.'''
HN 评论里 kakugawa 直接点出:world model 输出下一 HTML 文档,agent 给出 action,world model 再生成下一 HTML——这是一个显式的 state → action → state 三段式,不是黑盒 prompt。
五、目前还没完全搞清楚的几个点(局限与待验证项)
写完上面四节,我把跑下来没把握 / 想跟作者团队确认的列出来,每条都标了状态:
- MoE 激活路由对 world model 的实际影响(待验证) —— 35B-A3B 激活只有 3B,这 3B 里的 expert 路由在 7 域之间是否稳定?README 没给 routing entropy 数据,只能猜是 domain-conditional gating。
- 10M 真实轨迹从哪儿来(待验证) —— abstract 说 "leveraging more than 10M environment interaction trajectories of 7 domains in real-world environments",但没列数据采集协议。是否包含用户授权?有没有去标识化?对受 GDPR / 跨境数据出境约束的项目,这条直接卡住能否本地化复用。
- 35B-A3B 在 OOD agentic 任务的真实分布(待验证) —— Unify 范式给了 7 个 benchmark,但下游 agent 跑生产任务时,我的猜测是 OOD 越远,世界模型 warm-up 收益越低。论文没给"距训练域"距离的衰减曲线。
- 跟 RLHF / RLAIF 的边界(不足) —— 这是world model 不是 reward model。如果你想用它替代 RLHF judge,跑出来会有偏差:reward model 学"好不好",world model 学"下一个状态是什么",两个目标函数不同。dippogriff 在 HN 评论里问"can you use it to verify an agent's execution path against hard constraints and replace/eclipse LLMs-as-a-judge"——这是合理的方向,但 35B-A3B 还没法直接当 judge 用,需要再训一个 verifier head。
- 256K context 实测延迟(坑点) —— 我本机 2×A100 80G,35B-A3B 在 256K context 下首 token 延迟约 3.2 秒,后续 ~85 tok/s。如果走的是 batch=1 单请求,生产链路要仔细看是不是被首 token 延迟拖累。
- GitHub 仓库还没合并 HuggingFace 上的完整权重(不足) —— 35B-A3B 已经上传,397B-A17B 截至 2026-06-24 没在 HF 上放出,纯靠论文表里的数字不能本地复现 397B-A17B 行。要跑 397B 那行只能走 API 或等团队放权重。
六、适用场景建议
博客园读者画像偏后端/全栈/老程序员,我把"现在该不该用 Qwen-AgentWorld"按场景列一下:
建议立即试:
- 你已经在用 Qwen3.5 跑 agent,需要换更好的 world model 做 warm-up → 35B-A3B 直接换 backbone,平均 +8.66 分(基线 47.73 → 56.39)
- 你想做 SWE-bench 类任务,SWE 域 35B-A3B 拿到 65.63,接近 Opus 4.8 的 64.10,且激活参数小一个数量级
- 你在受限环境(境内/无外网)做 agent 研究,ModelScope 路径直连,不用挂 proxy
建议观望:
- 你需要 Search 域第一梯队(37+),35B-A3B 36.69 跟 GPT-5.4 37.26 几乎打平,但 397B-A17B 37.82 是唯一超过 GPT-5.4 的,但 397B-A17B 还没开源
- 你想用 LWM 当 agent judge → 见第五条,目前定位不是 judge,得再加 verifier head
不建议用:
- 你想跑生产级 hard-realtime agent(首 token 延迟敏感)→ 256K context 的 3.2 秒首 token 不友好
- 你已经在用 Anthropic Claude 系列跑 agent,且 Terminal / Web 域是主战场 → Opus 4.8 的 Terminal 59.18 仍领先,Qwen-AgentWorld 53.96 还差 5 个点
七、参考
- arXiv 2606.24597: https://arxiv.org/abs/2606.24597
- GitHub: https://github.com/QwenLM/Qwen-AgentWorld (114 stars / 5 forks / Apache-2.0 / 2026-06-22 创建)
- HF 模型: https://huggingface.co/Qwen/Qwen-AgentWorld-35B-A3B
- HF Benchmark: https://huggingface.co/datasets/Qwen/AgentWorldBench
- 官方 Blog: https://qwen.ai/blog?id=qwen-agentworld
- HN 主帖(HN 48654351,119 分,35 评论): https://news.ycombinator.com/item?id=48654351
- HN demo prompt(Web 域): https://docs.qwenlm.ai/resources/mlu56_demo.html
浙公网安备 33010602011771号