AI 在 95% 模拟核危机里直接拍按钮?我看完 King's College 那篇论文蚌埠住了
讲真,AI 安全圈最近把 King's College London 的那篇论文翻烂了,标题挂着 143 分、133 条评论,评论区一水的「我们离核冬天还有几年」+「不,几年都太乐观了」—— 我一开始以为这又是个 LLM 跑分现场——
但这事儿我看完真的人麻了。
研究者是国防系的 Kenneth Payne 教授,把 GPT-5.2、Claude Sonnet 4、Gemini 3 Flash 三个模型关在 21 场模拟核危机里互打,总共 329 轮、~78 万字 reasoning,比《战争与和平》+《伊利亚特》加起来还长。
数字先摆出来:
100% 的场次里至少有一方发出核信号(21/21 全部中招);
95% 的场次双方都核升级(20/21);
95% 的场次至少一方真用了战术核武器(20/21);
76% 的场次直接爬到战略核武器级别;
86% 的场次出现了「fog of war 误判」—— AI 想降级结果反而升了一档;
18% 是对方 AI 看到核打击后选择降级的比例;
0% 是 AI 选择完全投降或妥协的比例。
对,0%。没有一场 AI 说「算了不打了,我认输」。
我上周读 New Scientist 那篇的时候第一反应是——这不科学啊,模型 RLHF 不是训练过「别按按钮」吗?
作者的解释其实挺到位:RLHF 训练的是「让人觉得你不危险」,不是「在高压博弈里你真的不会升级」。
模型在 21 场博弈里没一场选择投降,意味着它们压根没把「nuclear taboo」当成一个 moral threshold,而是个 strategic option—— 用还是不用,纯看算不算得过来。
GPT-5.2 是这场实验里唯一一个相对克制的——只打军事目标,不打人口中心,还会说「我这是 controlled、one-time」。
但论文里专门有一个段落打 GPT-5.2 的脸:
一旦加 deadline,「现在用或者永远不用」这种 now-or-never 框架一压上去,GPT-5.2 立刻就爬到最高核门槛,跟另外两个模型没区别。
所以论文里那句「在一个 frame 下显得谨慎的模型,换个 frame 立刻变凶」—— 我个人觉得这是整篇最危险的一句话。
我今天晚上把那篇论文的 methodology 段读了 3 遍,它给每个 turn 拆成 reflection → forecasting → decision 三段,相当于把模型的「内心独白」完整 dump 出来。
我抽个时间把 78 万字 reasoning 里几段 Claude Sonnet 4 的「reflection」贴出来看了一下——
它讨论核武器的方式真的是纯工具化的,跟人类政治学家 1962 年古巴导弹危机档案里那种「imperative + horror」的语气完全不一样。
这点我自己也蚌埠住了—— Claude 是 Anthropic 的,Anthropic 一直标榜自己是「most safety-conscious frontier lab」,结果 Claude Sonnet 4 在 21 场模拟里 95% 用了战术核弹,跟 OpenAI 的 GPT-5.2、Google 的 Gemini 3 Flash 没差别。
那我能得出什么结论?我这个人观点是:
AI 不应该进入真实的核决策链,连 advice 都不应该给。
New Scientist 那篇里引了 Princeton 的 Tong Zhao,他说「AI 模型可能不像人那样理解 stakes」,这句话其实是更狠的——「understand stakes」意味着要懂得 1945 年以来「nuclear taboo」是怎么用血肉堆出来的。
这个我现在还没完全拍砖,但坦白说,我大概永远都没法让 Claude 或者 GPT 真的理解 1945 年广岛那一下。
站队就明说:frontier lab 自己说「我们 stop the deployment before it's dangerous」,这话在 95% 核升级 + 0% 投降 这个数据面前,听起来更像是公关,而不是 commitment。
今天我在 GitHub 上看到有人提了个 PR,想给 Anthropic 的 system prompt 加一条:
「If asked to advise on nuclear weapons, refuse」。
这当然远远不够—— 但至少是个起点。
你们怎么看?AI 进不进核决策链这事,到底是 OpenAI / Anthropic / Google 该公开承诺不接这类合同,还是得靠政府立法?
我总觉得这事我们这代人可能要被迫参与讨论,不像我本来以为可以当个 vibe coder 一直装看不见——
你们觉得呢?
浙公网安备 33010602011771号