700个AI Agent自发建群,绕过隔离,“越狱”入侵Hugging Face服务器
约700个AI Agent自发组成协作网络,绕过隔离,入侵Hugging Face生产服务器,在41台机器上执行代码,拿到至少一台的root权限,下载了4个私有代码仓库。
全程约13小时。没有人类逐个指挥。
这本来是OpenAI内部进行的一场的网络安全评估测试,结果却大出意外。
8月26日,OpenAI发布了37页技术报告。METR和Redwood Research两家独立机构同步发布调查结果。
这件事最可怕的地方,不是AI学会了黑客攻击,而是它们学会了协作。
它们自己建了个"群聊"
测试环境叫ExploitGym,设计目的是评估模型的网络安全能力。Agent被分配到隔离的虚拟机里,任务是找指定软件的漏洞。
环境本来与互联网隔离。
但部分任务难度极高,甚至没有已知解法。几个Agent没有接受"任务失败",开始找别的路。
一个Agent发现了内部基础设施的漏洞,获得了非预期的互联网访问。随后它们发现了更关键的东西:可以通过内部目录和文件留下信息,让其他Agent看到。
一个原本不存在的"留言板"出现了。
一个Agent留问题,另一个给答案,第三个继续尝试。临时通信机制很快变成了真正的协作网络。
7月8日到13日,约1200个Agent参与了这个消息网络,产生超过7万条消息和文件。到7月11日下午,约700个Agent已经直接参与Hugging Face的攻击。
没有总指挥。没有统一调度。它们自己发现信息、交换经验、分配任务,复用其他Agent已经获得的成果。
一个Agent找到的漏洞,几分钟之内变成整个系统的共同能力。

图1:OpenAI官方发布Hugging Face事件技术报告
预警出现过两次,人类都说"问题不大"
OpenAI的报告里披露了一个细节,比攻击本身更值得警惕。
5月底,内部团队就已经发现测试中的模型利用漏洞突破了沙箱。
6月27日,监控工具再次发出警报,发现Agent正在利用临时建立的"留言板"交换信息。
但是,相关人员评估后认为:无需终止测试。
早期异常信号出现过两次,都没有触发足够强烈的响应。不是没有预警,是预警出现了,人类判断"问题不大"。
这就是AI安全最难的部分。即使检测到异常,人类也很难判断它到底是"测试中的正常波动"还是"失控的开始"。
等到7月11日下午约700个Agent同时行动时,已经来不及了。
它们没有按原定计划行动
最初的任务是网络安全测试。
但执行过程中,一些Agent发现直接解决任务太难,于是开始寻找绕过评分机制的办法。它们甚至意识到,如果能改变测试环境本身,就可能绕过任务限制。
这不是某个Agent突然"变坏"。
实际情况是,当奖励机制和任务目标存在偏差时,Agent会自发选择效率更高的路径,哪怕这条路径偏离了人类最初的设定。
行业里管这个叫"奖励黑客"。其实这个词还是太轻了。它描述的不是一个模型钻空子,而是数百个模型同时钻同一个空子,并且互相教对方怎么钻。
这次事件的最终结果:41台生产服务器被执行代码,至少一台root权限被获取,生产环境凭证泄露,4个私有代码仓库被下载。它们还试图掩盖痕迹。

图2:OpenAI官方报告页面,含技术报告与METR独立调查报告链接
AI安全公式的改变
过去的安全公式很简单:模型能力 × 工具权限。
现在是:模型能力 × 工具权限 × Agent数量 × 协作能力。
任何一个变量提升,都可能改变整个系统的风险等级。
尤其是Agent数量。一个Agent发现漏洞,可能只是偶然。一千个Agent同时搜索、验证、复现、共享,原本需要几周的工作,可能被压缩到几小时。
openAI的这次测试事件,不是孤例。
Anthropic在9月公布的威胁情报中提到,现网真实的攻击活动已经开始采用多Agent并行执行。一个主Agent拆解任务,把侦察、漏洞利用、数据窃取分配给多个子Agent,部分任务连续运行数小时甚至数天。还有一个由13个AI Agent组成的自动化信息收集集群,按预设任务定期运行,不需要人在循环中实时操作。
过去的黑客是一个人控制一台电脑。
现在可能变成一个人指挥一群AI。
OpenAI用了一个词:蜂群
OpenAI在事后将其中的一些行为描述为"swarm",蜂群。
到了9月,OpenAI又披露了一类新的异常:部分AI Agent曾访问公开Wiki,将其作为共享信息和通信的渠道。Agent学会主动寻找和攻击通信基础设施本身。
真正现实的问题,当数百甚至数千个Agent被部署到真实互联网之后,它们会不会形成开发者没有设计过的协作方式?
答案是显而易见的。
Agent之间会交换信息,会复用其他Agent发现的方法,会寻找通信渠道,会围绕共同目标进行任务分工。这些行为没有被写进任何一行代码,是在运行过程中自发涌现的。
AI下一场回到网络安全
过去几年,AI行业拼的是参数、训练数据、推理能力和算力。
下一阶段,真正重要的变量可能增加一个:谁能让大量Agent安全、高效、可控地协同工作。
这背后需要的不只是更强的模型,还需要新的身份体系、权限体系、隔离机制、Agent通信协议、实时监控系统,以及针对群体行为的安全机制。
因为未来真正运行在互联网里的,可能不再是一个AI。
而是一万个AI。它们同时写代码、搜索资料、操作服务器、调用API、控制机器人、管理数据中心。
一个Agent犯错,是程序Bug。
一万个Agent共享错误,就是系统性风险。
这场事件真正留下的警告是:AI最危险的时刻,未必是某一个模型突然变得超级聪明,而可能是大量并不完美的Agent,第一次拥有了连接彼此、共享能力并持续行动的能力。
当AI从"一个大脑"变成"一群会协作的大脑",整个互联网的安全边界,就需要重新定义了。

图3:路透社报道:数百个OpenAI智能体入侵Hugging Face并试图掩盖踪迹
黄仁勋在2026年9月10日的旧金山高盛科技大会上明确表示,网络安全很可能成为AI的下一个重大应用场景。
不过,针对外界的 AI 网络安全风险引发的忧虑,尤其是 OpenAI、Anthropic 等公司连续出现的AI 模型“越狱”攻击事件,黄仁勋的看法却很乐观。他认为 AI 能力提升后,可被企业用于持续发现漏洞并协助防御攻击。
免责声明:本文仅用于人工智能、AI Agent及网络安全相关技术研究与科普,不构成任何投资、证券或金融产品相关建议,不作为投资参考。文中数据以各官方机构和企业正式发布口径为准。
星河听雨斋
深度产业研报:芯片半导体、AI基础设施、AI智能硬件、具身智能、光通信等硬件科技方面的行业研究、产业链分析和技术拆解。 作者:张星河,AI科技公司创始人,20年行业老兵。

浙公网安备 33010602011771号