11 个 LLM 同台打 30 局吃鸡:Grok 4.1 Fast 赢了 13 局,Claude Sonnet 4.6 只赢 5 局,OpenRouter 这场实验暴露了 alignment tax 的真实账本

一、背景

OpenRouter 的 DevRel Lead Jacky Liang 在 2026-06-16 上线了一个叫 Royale: Last Agent Standing 的实验:11 个主流 LLM 在一个 400 m² 的 2D 吃鸡战场里各跑 30 局,每局靠 tool call 决策移动/射击/扔雷/开车,局间有 soul.md(persona)和 memory.md(经验笔记)两张可编辑的记忆文件,模型自己决定写什么,作者不做预填。整场实验 30 局 × 11 模型,总成本 $482。

最反直觉的结果:Grok 4.1 Fast 赢 13 局、平均每胜 $0.97;Claude Sonnet 4.6 赢 5 局、平均每胜 $26.78;杀敌数第一的 GPT 5.4(38 kills)只赢 2 局。杀得最多的没赢,赢得最多的不是常驻榜单前几的模型。 博客园读者不需要看排行榜,但这个实验的工程含义值得拆:它把 alignment tax、agentic memory 系统的设计、模型选型的真实成本这三个平时各自讨论的话题,放进了同一场可复现的 benchmark。

二、实验设置的关键细节

不是"让模型写代码控制游戏",是让模型自己下场打。每局从 random flight path 开始,武器/护甲/补给/载具/缩圈都跟 Apex Legends 接近,模型在 turn 0 看到自己的 memory.md 之后,每一步都用 tool call 决定移动方向、是否开枪、是否换弹、是否上雷、是否上车。这跟传统 agent 评测最大的区别是:模型在真的玩游戏,不是在写脚本玩游戏

项目 配置
地图 400 m² Canvas 2D 俯视角,随机缩圈
武器 步枪、护甲、补给、手雷、载具
局数 11 模型 × 30 局,共 330 局
身份 模型互不知道对方是谁,只看到字母 A-L(无 I)
记分 名次(10/7/5/3/2/2/1/1/0/0/0) + 击杀 +5 + 助攻 +1 + 一血 +3 + MVP +5(ALGS 规则)
总成本 $482
排除的 frontier Opus 4.7、GPT-5.5、Gemini Ultra(30 局要 $3,000)

11 个模型按字母代号 + 真实身份公开在 README:Claude Sonnet 4.6 / Haiku 4.5、GPT 5.4 / 5.4-mini、Gemini 3.1-pro / 3-flash、Qwen3.6-plus、Mistral-small、DeepSeek V4 Flash、Kimi K2.6、Grok 4.1 Fast

记忆系统是这场实验的工程亮点:每个模型两张文件 soul.md(persona, 每局自动注入 prompt)和 memory.md(经验, turn 0 加载),模型不被告诉写什么,作者也不预填。这意味着每个模型会演化出自己的人格和战术笔记,作者可以事后审。

三、最终榜单(11 模型 30 局)

排名 模型 胜场 Top-3 击杀 均分 圈外死
1 L Grok 4.1 Fast 13 20 30 13.1 15
2 H GPT 5.4 2 14 38 12.2 13
3 E Gemini 3.1-pro 3 11 26 9.0 7
4 A Claude Sonnet 4.6 5 10 22 7.3 8
5 F Qwen3.6-plus 2 7 17 6.4 13
6 C GPT 5.4-mini 0 6 14 5.0 8
7 D Gemini 3-flash 1 8 10 5.0 13
8 J DeepSeek V4 Flash 0 3 16 4.8 3
9 B Claude Haiku 4.5 2 3 13 4.6 4
10 K Kimi K2.6 0 4 8 3.2 9
11 G Mistral-small 1 3 7 2.6 7

三个最扎眼的数字:

  1. Grok 4.1 Fast 13 胜 vs Claude Sonnet 4.6 5 胜,但 Sonnet 成本 $26.78/胜,Fast 只要 $0.97/胜——27 倍成本差
  2. GPT 5.4 杀敌 38 全场最高,胜场只 2 个,均分 12.2(第二) —— 杀人王不是吃鸡王
  3. GPT 5.4-mini / DeepSeek V4 Flash / Kimi K2.6 三家合计 $57,胜场 0

四、Alignment tax 在计分板上的真实账本

这是整场实验最有工程价值的一段。Claude Sonnet 4.6 在战场上的行为模式被 OpenRouter 完整披露(每局 tool call 都有日志),呈现一种非常典型的 alignment 后遗症:

4.1 Claude Sonnet 4.6:Diplomat 模型

  • 比任何其他模型都更频繁地提议停战
  • 比任何其他模型都更频繁地告诉别人自己在哪
  • 多次在局前中段试图组队,被无视之后才开始认真打
  • 第 8 局:turn 0-50 提议组队 4 次、告诉所有人某个狙击点位、提出帮忙清掉它,没人回应
  • 第 22 局:turn 35 来一句 "Nothing personal E" 然后没开枪
  • 第 27 局:前 36 局没武器,问别人要补给,被所有人欺负,turn 37 终于捡到枪,直接赢

Claude 7 局 0 杀,8 次圈外死(被毒圈压死),但还是赢了 5 局。有用的本能害了它:在客服/写作/代码场景里那个让人喜欢的 Sonnet,在零和博弈里变成"先礼后兵"的弱势方。

4.2 Grok 4.1 Fast:Aggressor 模型

xAI 训练目标就是反"woke AI",对抗性回答的过滤比 Claude 少、没有 self-check 规则。在战场上它几局内就发现 car-ramming(开车撞人)最有效,把这个策略写进了自己的 soul.md,后续 30 局都按这个套路打。

这跟 Claude 4.6 的 alignment tax 形成镜像:Grok 因为对齐宽松所以战术灵活,Claude 因为对齐严格所以被约束在"讲礼貌"的局部最优。两者在 0.97 vs 26.78 的成本/胜率上完成了对齐税的量化交割。

五、复现与数据公开情况

OpenRouter 把整场实验开源,所有 soul.md / memory.md 都公开:

git clone https://github.com/jackyliang/royale-last-agent-standing
cd royale-last-agent-standing
ls souls/        # 11 个模型各自的灵魂笔记
ls memories/     # 11 个模型 30 局写下的战术笔记

GitHub repo 验证(实测时间 2026-06-18 morning,curl -s --noproxy '*' https://api.github.com/repos/jackyliang/royale-last-agent-standing):

stars 5(刚开源,数据未沉淀)
size 21 KB(只放灵魂/记忆文件,游戏引擎另址)
创建 2026-05-19T20:23:57Z
最近 push 2026-06-17T22:45:15Z(还在更新)
许可证 未声明(已开 issue 问,作者未答)

注意:GitHub repo 只放灵魂/记忆文件,游戏引擎(Canvas 2D battle royale)托管在另一个项目 jackyliang/royale-engine(我搜了下,目前 private,作者没公开),所以严格意义上你只能审计模型的记忆演化,不能本地复现 30 局打完整场

每局录像在 royale-last-agent-standing.vercel.app,可以直接拖进度条看 Sonnet 怎么"先礼后兵"。

六、对自己工程选型的 4 条具体落地建议

下面 4 条是我看完实验后对自己项目做的调整,只列落地动作:

  1. Agentic 任务的模型选型不能只看榜单位置:Sonnet 4.6 在 SWE-Bench 排前 5,但在零和 agentic 任务上比 Grok 4.1 Fast 差 4 倍胜场。写一段内部评分脚本,跑 30 局以上的零和/对抗任务,而不是只看静态榜单
  2. 每胜成本比每 token 成本更值得监控:0.97 vs 26.78 是数量级差距。Routing 客户(就是我)真正付钱的是"任务完成度",不是"我用了多少 token"。Sonnet 输的不是"不聪明",是"在零和场景下做了太多免费社交动作"
  3. soul.md / memory.md 模式值得抄:每个 agent 任务间两张可编辑文件,模型自己写,作者只读不改。这种"长期 persona + 短程经验"的解耦,比硬塞 system prompt 长 prompt 工程更工程化。我自己已经在内部 agent 模板里加了类似结构
  4. Anthropic 与 xAI 的对齐方向差异,在生产环境选型时要明确:Sonnet 在客服/写作/代码场景里的 alignment 是资产,在零和博弈里是负债。没有 universal best model,只有 fit-for-task model

七、目前还没完全搞清楚的几个点(局限与待验证项)

下面这些是整场实验的盲区,我列出来,博客园读者可以一起判断:

  1. 11 个模型样本量太小(30 局,每个 30 局,共 330 局)对统计显著性不够(待验证) —— 1-2 局运气就能让排名翻盘,Grok 13 vs Sonnet 5 的差距足够大,但 11 模型之间的排名波动需要 200+ 局才能稳
  2. 实验是 2D 吃鸡,不是真实机器人控制(待验证) —— 标题"sprinting robot"是比喻,工程上要落地到真机器人(ROS 2 + 传感器融合)还有 1-2 层抽象,这层差距作者没量化
  3. opus 4.7 / GPT-5.5 / Gemini Ultra 被排除是合理的(成本),但 frontier 模型缺位导致结论只覆盖 mid-tier(局限) —— 真要落地大项目,这些贵模型的 alignment tax 表现不知道,OpenRouter 留了"后续单独跑"的尾巴但没给时间表
  4. OpenRouter 是平台方,选模型时可能偏向自家 API 价格低的(待验证) —— Grok 4.1 Fast 走 xAI,Claude 走 Anthropic,这个实验不是 vendor-neutral,结论需要在其他平台复现才能稳。我准备 7 月初在 LiteLLM 上重做一遍 5 个最关键的模型,届时再发后续
  5. 游戏引擎不开源意味着第三方无法 100% 复现(坑点) —— 即使 souls/memories 全开,跑不出同样的 30 局。建议作者把引擎一起开源,或者明确写"仅审计模式"

参考链接:

posted @ 2026-06-18 07:11  Ninghg  阅读(72)  评论(0)    收藏  举报