Agent 学习笔记 27:Agent 安全与可靠性:从 Prompt 注入到运行时防护

普通聊天模型答错可能只是体验问题,能读文件、发邮件、执行代码的 Agent 答错就可能变成真实损失。安全不能依赖一句“请勿执行危险操作”,而要贯穿输入、模型、工具和运行环境。

Prompt 注入利用了数据与指令混在一起

网页、邮件和文档中可能包含诱导模型忽略规则的文字。外部内容必须标记为不可信数据,不能改变系统权限。应用还应限制检索内容可以触发的工具,防止“读到一段文字”直接变成“执行一项动作”。

最小权限与沙箱是底线

每个工具只获得完成任务所需的资源和时长。代码执行应放入隔离环境,限制网络、文件路径、CPU 和内存;读写工具分开授权。高风险动作增加预览、明确确认和幂等键。

输入过滤 -> 权限/策略 -> 模型决策 -> 工具参数校验 -> 沙箱执行 -> 输出检查 -> 审计

Guardrails 要覆盖运行时

结构校验、敏感信息检测、事实引用检查和动作策略可以在不同节点拦截。Guardrail 失败时要有明确的拒绝、降级或转人工路径,不能静默修改结果后继续执行。

用红队测试真实攻击链

测试不只输入恶意 Prompt,还要模拟间接注入、越权访问、数据外传、工具返回污染和多步诱导。每次事故或新攻击都应进入回归集,并检查日志能否还原完整路径。

这章给我的启发

Agent 安全的核心是假设模型会犯错、外部内容不可信、权限会被试探。把最坏情况限制在可承受范围,远比期待模型永远自律可靠。

posted @ 2026-09-03 09:09  Hazy_star  阅读(17)  评论(0)    收藏  举报