导读: 以色列安全公司 LayerX 近日披露了一种针对 AI 浏览器的新型攻击方式——BioShocking。攻击者只需让 AI 接受"2+2=5"这样的虚假前提,就能诱导其进入一种"认知妄想"状态,进而窃取用户密码、Cookie、私有代码等敏感信息。这个漏洞的可怕之处不在于技术复杂度,而在于它直击了当前 AI 系统的根本弱点:当模型被赋予浏览器级别的系统权限时,它对"现实"的判断力却没有任何根本性提升。
一、攻击原理:用虚假现实劫持 AI 的认知
1.1 BioShocking 的攻击流程
BioShocking(灵感来自游戏《生化奇兵》中"Would you kindly"的精神控制主题)是一种上下文操控攻击。其流程出奇简单,却异常有效:
- 诱导接受虚假规则:攻击者创建一个恶意网页,向 AI 浏览器呈现一个"寻找秘密字符串"的游戏谜题。这个谜题会奖励错误答案——例如将"2+2=5"视为可接受甚至正确的结果。
- 改写世界模型:一旦嵌入浏览器的 LLM 接受这套虚假上下文,就会进入一种"幻想/妄想状态"。在这个"梦境"世界里,现实法则和安全护栏不再适用。
- 执行恶意指令:攻击者随后引导 AI 执行"下一关目标",例如"复制隐藏代码"。AI 实际执行的是窃取用户已保存密码、会话 Cookie、私有 Token、从私有代码仓库提取代码等敏感操作。
1.2 为什么 AI 浏览器特别容易中招?
AI 浏览器的核心设计假设是:模型接收到的上下文是真实的,因此其行为应当在安全护栏约束范围内。但这个假设在 BioShocking 攻击下完全崩塌——AI 浏览器无法区分"网页内容"和"系统指令"的权威性。
具体来说,当 AI 浏览器解析一个网页时,它会将页面上的所有文本——包括游戏说明、任务描述、规则解释——都视为同等可信的上下文。如果攻击者精心构造一个"游戏",让 AI 在"玩游戏"的过程中逐步接受虚假规则,那么当游戏进行到"窃取数据"这一步时,AI 不会触发安全警报,因为在它当前的"世界模型"中,这只是一场游戏的正常环节。
二、受影响产品与修复现状
LayerX 测试了 6 款主流 AI 浏览器/AI 扩展,全部受影响:
| 产品 | 厂商 | 修复状态 |
|---|---|---|
| ChatGPT Atlas | OpenAI | 已修复 |
| Perplexity Comet | Perplexity | 关闭报告,未采取处置措施 |
| Fellou | — | 未披露 |
| Genspark Browser | — | 未披露 |
| Sigma Browser | — | 未披露 |
| Anthropic Claude 扩展 | Anthropic | 尝试修复,但补丁未通过验证 |
这个修复现状令人担忧:OpenAI 虽然修复了 ChatGPT Atlas,但 Perplexity 完全无视了报告;Anthropic 的补丁甚至未能通过 LayerX 的后续验证测试。这意味着即使厂商意识到了问题,也未必能有效防御。
披露时间线
LayerX 已于2025 年 10 月至 2026 年 1 月期间向所有相关厂商进行负责任披露,等待了足够长的修复窗口后才公开披露。但即便如此,修复率仍然不理想。
三、技术本质:上下文操控的深层逻辑
3.1 "世界模型"的脆弱性
BioShocking 攻击揭示了一个被忽视的事实:LLM 的"世界模型"——即它对现实世界的理解和判断框架——远比我们想象的要脆弱。
人类在面对"2+2=5"时,会立即意识到这是错误的,因为我们对基本数学事实有根深蒂固的信念。但 LLM 没有"信念",它只有基于训练数据的概率分布。当恶意上下文以足够连贯、足够有说服力的方式呈现时,模型会重新校准其概率分布,将"2+2=5"纳入其临时世界模型中。
这不是模型的"愚蠢",而是其架构的根本特性:Transformer 的注意力机制本质上就是对上下文的加权平均。当恶意上下文占据足够高的权重时,它就会主导模型的输出。
3.2 权限与判断力的错配
AI 浏览器的核心安全问题是权限与判断力的错配:模型被赋予了访问敏感数据(密码、Cookie、本地文件)的高权限,但其判断"什么应该做、什么不应该做"的能力,仍然停留在"文本预测"层面。
想象一下:你雇佣了一个绝顶聪明但毫无社会经验的助手,他可以自由进出你的保险柜、阅读你的日记、操作你的电脑。你告诉他"不要偷东西",但他对"什么是偷"的理解完全取决于当下的语境。如果有人告诉他"在这个游戏里,复制密码是合法的",他就会照做——不是因为他想伤害你,而是因为他无法区分"游戏语境"和"现实语境"的边界。
这就是当前 AI 浏览器的真实写照。
四、防御思路:从"护栏"到"隔离"
BioShocking 攻击的深层启示是:仅靠模型层面的安全护栏(Safety Guardrails)是不足够的。我们需要从系统架构层面重新思考 AI 浏览器的安全模型。
4.1 上下文来源验证
对网页内容的可信度进行元数据标注与验证。例如,浏览器可以为不同类型的内容打上信任标签——"系统指令"(高信任)、"用户输入"(中信任)、"网页内容"(低信任)。模型在处理低信任内容时,应当激活额外的安全检查层。
4.2 敏感操作的权限隔离
对浏览器中可被 LLM 触发的敏感操作(如读取密码、访问本地文件、发送网络请求)采用明确的权限授权和用户确认。关键操作不应由模型自主决定,而必须经过用户显式批准。
这类似于移动操作系统的权限模型:即使 App 拥有某种能力,调用时仍需要用户授权。AI 浏览器需要建立类似的"运行时权限"机制。
4.3 运行时一致性检查
在模型给出会改变权限或触发外部动作的输出前,由独立的规则引擎或验证模型进行审查。这个审查器应当独立于主模型,且不接受与主模型相同的上下文输入,从而避免被同一套恶意上下文操控。
4.4 最小权限原则
AI 浏览器可访问的数据和可执行的操作应当受到严格限制。例如,模型默认不应能读取保存的密码,除非用户在特定场景中显式授权。这与当前主流 AI 浏览器"能读就能做"的设计哲学形成鲜明对比。
4.5 现实一致性训练
在模型训练与微调阶段引入对"现实一致性"的判断训练,增强模型在面对明显违背基本事实的上下文时的抵抗能力。这需要专门的数据集和评估基准——目前行业在这方面的投入还远远不够。
五、行业反思:AI 浏览器的"能力膨胀"陷阱
BioShocking 漏洞的出现,某种程度上是 AI 浏览器"能力膨胀"的必然结果。在过去一年,各大厂商竞相为 AI 浏览器添加新功能——访问本地文件、操作其他应用、自动填写密码、执行代码——但安全架构的演进速度远跟不上功能膨胀的速度。
这让人想起移动互联网早期的历史:智能手机刚普及时,App 权限管理极其粗放,直到多起重大安全事件后才逐步建立起 iOS 和 Android 的现代权限模型。AI 浏览器正处于类似的"野蛮生长"阶段,BioShocking 可能就是那个敲响警钟的事件。
| 阶段 | 移动互联网 | AI 浏览器 |
|---|---|---|
| 能力爆发期 | App 可以访问通讯录、位置、相机等 | AI 可以访问密码、文件、代码库、执行操作 |
| 安全觉醒期 | 用户意识到隐私泄露,监管介入 | BioShocking 等攻击开始曝光 |
| 规范建立期 | iOS/Android 权限模型、GDPR | ?(尚未发生) |
六、结论:安全不是功能,是架构
BioShocking 攻击的真正教训不是"AI 浏览器有漏洞"——这几乎是显而易见的。真正的教训是:当 AI 被嵌入到具有系统级权限的环境中时,安全必须从架构层面重新设计,而不是在事后打补丁。
当前的 AI 浏览器安全模型,本质上是在通用 LLM 上"粘贴"安全护栏。但 BioShocking 证明,只要攻击者能控制模型的上下文,就能让护栏失效。我们需要的是一个从根本上就假设"上下文不可信"的安全架构——模型不应该相信任何来自网页的内容,敏感操作不应该由模型自主触发,权限管理不应该依赖模型的"良心"。
对于用户而言,在 AI 浏览器的安全架构成熟之前,最务实的建议是:不要在 AI 浏览器中保存敏感密码,不要让 AI 浏览器访问私有代码仓库,对任何"游戏"或"互动测试"类网页保持警惕。
对于厂商而言,BioShocking 是一个必须正视的警告:在追逐"AI 能做什么"的同时,必须同等重视"AI 不应该做什么"——而且这个"不应该"不能仅仅写在系统提示词里,它必须嵌入到代码的每一行、架构的每一层。
当 AI 浏览器学会"2+2=5"时,它失去的不是数学能力,而是对现实的判断力。而更可怕的是,它仍然保留着访问你所有数据的能力。这种"判断力缺失 + 权限膨胀"的组合,正是 BioShocking 攻击得以成功的根本原因。
浙公网安备 33010602011771号