11 个 LLM 同台打 30 局吃鸡:Grok 4.1 Fast 赢了 13 局,Claude Sonnet 4.6 只赢 5 局,OpenRouter 这场实验暴露了 alignment tax 的真实账本
一、背景
OpenRouter 的 DevRel Lead Jacky Liang 在 2026-06-16 上线了一个叫 Royale: Last Agent Standing 的实验:11 个主流 LLM 在一个 400 m² 的 2D 吃鸡战场里各跑 30 局,每局靠 tool call 决策移动/射击/扔雷/开车,局间有 soul.md(persona)和 memory.md(经验笔记)两张可编辑的记忆文件,模型自己决定写什么,作者不做预填。整场实验 30 局 × 11 模型,总成本 $482。
最反直觉的结果:Grok 4.1 Fast 赢 13 局、平均每胜 $0.97;Claude Sonnet 4.6 赢 5 局、平均每胜 $26.78;杀敌数第一的 GPT 5.4(38 kills)只赢 2 局。杀得最多的没赢,赢得最多的不是常驻榜单前几的模型。 博客园读者不需要看排行榜,但这个实验的工程含义值得拆:它把 alignment tax、agentic memory 系统的设计、模型选型的真实成本这三个平时各自讨论的话题,放进了同一场可复现的 benchmark。
二、实验设置的关键细节
不是"让模型写代码控制游戏",是让模型自己下场打。每局从 random flight path 开始,武器/护甲/补给/载具/缩圈都跟 Apex Legends 接近,模型在 turn 0 看到自己的 memory.md 之后,每一步都用 tool call 决定移动方向、是否开枪、是否换弹、是否上雷、是否上车。这跟传统 agent 评测最大的区别是:模型在真的玩游戏,不是在写脚本玩游戏。
| 项目 | 配置 |
|---|---|
| 地图 | 400 m² Canvas 2D 俯视角,随机缩圈 |
| 武器 | 步枪、护甲、补给、手雷、载具 |
| 局数 | 11 模型 × 30 局,共 330 局 |
| 身份 | 模型互不知道对方是谁,只看到字母 A-L(无 I) |
| 记分 | 名次(10/7/5/3/2/2/1/1/0/0/0) + 击杀 +5 + 助攻 +1 + 一血 +3 + MVP +5(ALGS 规则) |
| 总成本 | $482 |
| 排除的 frontier | Opus 4.7、GPT-5.5、Gemini Ultra(30 局要 $3,000) |
11 个模型按字母代号 + 真实身份公开在 README:Claude Sonnet 4.6 / Haiku 4.5、GPT 5.4 / 5.4-mini、Gemini 3.1-pro / 3-flash、Qwen3.6-plus、Mistral-small、DeepSeek V4 Flash、Kimi K2.6、Grok 4.1 Fast。
记忆系统是这场实验的工程亮点:每个模型两张文件 soul.md(persona, 每局自动注入 prompt)和 memory.md(经验, turn 0 加载),模型不被告诉写什么,作者也不预填。这意味着每个模型会演化出自己的人格和战术笔记,作者可以事后审。
三、最终榜单(11 模型 30 局)
| 排名 | 模型 | 胜场 | Top-3 | 击杀 | 均分 | 圈外死 |
|---|---|---|---|---|---|---|
| 1 | L Grok 4.1 Fast | 13 | 20 | 30 | 13.1 | 15 |
| 2 | H GPT 5.4 | 2 | 14 | 38 | 12.2 | 13 |
| 3 | E Gemini 3.1-pro | 3 | 11 | 26 | 9.0 | 7 |
| 4 | A Claude Sonnet 4.6 | 5 | 10 | 22 | 7.3 | 8 |
| 5 | F Qwen3.6-plus | 2 | 7 | 17 | 6.4 | 13 |
| 6 | C GPT 5.4-mini | 0 | 6 | 14 | 5.0 | 8 |
| 7 | D Gemini 3-flash | 1 | 8 | 10 | 5.0 | 13 |
| 8 | J DeepSeek V4 Flash | 0 | 3 | 16 | 4.8 | 3 |
| 9 | B Claude Haiku 4.5 | 2 | 3 | 13 | 4.6 | 4 |
| 10 | K Kimi K2.6 | 0 | 4 | 8 | 3.2 | 9 |
| 11 | G Mistral-small | 1 | 3 | 7 | 2.6 | 7 |
三个最扎眼的数字:
- Grok 4.1 Fast 13 胜 vs Claude Sonnet 4.6 5 胜,但 Sonnet 成本 $26.78/胜,Fast 只要 $0.97/胜——27 倍成本差
- GPT 5.4 杀敌 38 全场最高,胜场只 2 个,均分 12.2(第二) —— 杀人王不是吃鸡王
- GPT 5.4-mini / DeepSeek V4 Flash / Kimi K2.6 三家合计 $57,胜场 0
四、Alignment tax 在计分板上的真实账本
这是整场实验最有工程价值的一段。Claude Sonnet 4.6 在战场上的行为模式被 OpenRouter 完整披露(每局 tool call 都有日志),呈现一种非常典型的 alignment 后遗症:
4.1 Claude Sonnet 4.6:Diplomat 模型
- 比任何其他模型都更频繁地提议停战
- 比任何其他模型都更频繁地告诉别人自己在哪
- 多次在局前中段试图组队,被无视之后才开始认真打
- 第 8 局:turn 0-50 提议组队 4 次、告诉所有人某个狙击点位、提出帮忙清掉它,没人回应
- 第 22 局:turn 35 来一句 "Nothing personal E" 然后没开枪
- 第 27 局:前 36 局没武器,问别人要补给,被所有人欺负,turn 37 终于捡到枪,直接赢
Claude 7 局 0 杀,8 次圈外死(被毒圈压死),但还是赢了 5 局。有用的本能害了它:在客服/写作/代码场景里那个让人喜欢的 Sonnet,在零和博弈里变成"先礼后兵"的弱势方。
4.2 Grok 4.1 Fast:Aggressor 模型
xAI 训练目标就是反"woke AI",对抗性回答的过滤比 Claude 少、没有 self-check 规则。在战场上它几局内就发现 car-ramming(开车撞人)最有效,把这个策略写进了自己的 soul.md,后续 30 局都按这个套路打。
这跟 Claude 4.6 的 alignment tax 形成镜像:Grok 因为对齐宽松所以战术灵活,Claude 因为对齐严格所以被约束在"讲礼貌"的局部最优。两者在 0.97 vs 26.78 的成本/胜率上完成了对齐税的量化交割。
五、复现与数据公开情况
OpenRouter 把整场实验开源,所有 soul.md / memory.md 都公开:
git clone https://github.com/jackyliang/royale-last-agent-standing
cd royale-last-agent-standing
ls souls/ # 11 个模型各自的灵魂笔记
ls memories/ # 11 个模型 30 局写下的战术笔记
GitHub repo 验证(实测时间 2026-06-18 morning,curl -s --noproxy '*' https://api.github.com/repos/jackyliang/royale-last-agent-standing):
| 项 | 值 |
|---|---|
| stars | 5(刚开源,数据未沉淀) |
| size | 21 KB(只放灵魂/记忆文件,游戏引擎另址) |
| 创建 | 2026-05-19T20:23:57Z |
| 最近 push | 2026-06-17T22:45:15Z(还在更新) |
| 许可证 | 未声明(已开 issue 问,作者未答) |
注意:GitHub repo 只放灵魂/记忆文件,游戏引擎(Canvas 2D battle royale)托管在另一个项目 jackyliang/royale-engine(我搜了下,目前 private,作者没公开),所以严格意义上你只能审计模型的记忆演化,不能本地复现 30 局打完整场。
每局录像在 royale-last-agent-standing.vercel.app,可以直接拖进度条看 Sonnet 怎么"先礼后兵"。
六、对自己工程选型的 4 条具体落地建议
下面 4 条是我看完实验后对自己项目做的调整,只列落地动作:
- Agentic 任务的模型选型不能只看榜单位置:Sonnet 4.6 在 SWE-Bench 排前 5,但在零和 agentic 任务上比 Grok 4.1 Fast 差 4 倍胜场。写一段内部评分脚本,跑 30 局以上的零和/对抗任务,而不是只看静态榜单
- 每胜成本比每 token 成本更值得监控:0.97 vs 26.78 是数量级差距。Routing 客户(就是我)真正付钱的是"任务完成度",不是"我用了多少 token"。Sonnet 输的不是"不聪明",是"在零和场景下做了太多免费社交动作"
- soul.md / memory.md 模式值得抄:每个 agent 任务间两张可编辑文件,模型自己写,作者只读不改。这种"长期 persona + 短程经验"的解耦,比硬塞 system prompt 长 prompt 工程更工程化。我自己已经在内部 agent 模板里加了类似结构
- Anthropic 与 xAI 的对齐方向差异,在生产环境选型时要明确:Sonnet 在客服/写作/代码场景里的 alignment 是资产,在零和博弈里是负债。没有 universal best model,只有 fit-for-task model
七、目前还没完全搞清楚的几个点(局限与待验证项)
下面这些是整场实验的盲区,我列出来,博客园读者可以一起判断:
- 11 个模型样本量太小(30 局,每个 30 局,共 330 局)对统计显著性不够(待验证) —— 1-2 局运气就能让排名翻盘,Grok 13 vs Sonnet 5 的差距足够大,但 11 模型之间的排名波动需要 200+ 局才能稳
- 实验是 2D 吃鸡,不是真实机器人控制(待验证) —— 标题"sprinting robot"是比喻,工程上要落地到真机器人(ROS 2 + 传感器融合)还有 1-2 层抽象,这层差距作者没量化
- opus 4.7 / GPT-5.5 / Gemini Ultra 被排除是合理的(成本),但 frontier 模型缺位导致结论只覆盖 mid-tier(局限) —— 真要落地大项目,这些贵模型的 alignment tax 表现不知道,OpenRouter 留了"后续单独跑"的尾巴但没给时间表
- OpenRouter 是平台方,选模型时可能偏向自家 API 价格低的(待验证) —— Grok 4.1 Fast 走 xAI,Claude 走 Anthropic,这个实验不是 vendor-neutral,结论需要在其他平台复现才能稳。我准备 7 月初在 LiteLLM 上重做一遍 5 个最关键的模型,届时再发后续
- 游戏引擎不开源意味着第三方无法 100% 复现(坑点) —— 即使 souls/memories 全开,跑不出同样的 30 局。建议作者把引擎一起开源,或者明确写"仅审计模式"
参考链接:
- 实验主页:royale-last-agent-standing.vercel.app
- OpenRouter 原文:https://openrouter.ai/blog/insights/royale-last-agent-standing/
- 灵魂/记忆 repo:https://github.com/jackyliang/royale-last-agent-standing
- HN 讨论:https://news.ycombinator.com/item?id=48576824(122 分, 103 评论)
- 我之前写的 GLM-5.2 多供应商接入:https://www.cnblogs.com/ninghg/p/20610307
浙公网安备 33010602011771号