PentAGI_项目介绍

AI开始自己做渗透测试了

多Agent协作 · Docker隔离执行 · 第三方基准45%检出率

—— 深度解析开源自动化渗透测试平台 PentAGI

【配图:PentAGI Web UI / 多Agent渗透测试流程图】

◆ ◇ ◆

【备选标题组】

▸ 第三方实测检出率45%:开源AI渗透平台PentAGI到底能不能打?

▸ 把Nmap、Metasploit、SQLMap交给AI:PentAGI让多Agent自己跑渗透流程

▸ 不是漏洞扫描器:这个开源项目让AI自己规划、执行并生成漏洞报告

▸ 20+安全工具装进Docker沙箱,PentAGI把自动化渗透做成了完整平台

▸ AI渗透测试走到哪一步了?从PentAGI的一次20漏洞基准说起

◆ ◇ ◆

01 项目介绍

PentAGI 到底是个什么东西?

PentAGI 是 vxcontrol 开源的一套自主渗透测试平台。它面向安全工程师、研究人员和授权测试团队,把大模型、多Agent调度、专业安全工具、长期记忆、Web界面与审计数据放进同一套工作流。

它和传统扫描器最大的区别,是不只按规则发请求、匹配特征,而是让Agent围绕测试目标持续做决策:收集信息、拆分任务、调用工具、分析回显、调整路线,并把结果整理成可读的漏洞报告。

当然,“自主”不等于“放任”。PentAGI把命令执行放进Docker沙箱,操作过程与输出写入PostgreSQL,并提供Prometheus、Grafana、Langfuse等可观测能力,方便人随时查看和介入。

【配图:Orchestrator → Specialist Agents → Docker Sandbox → Memory/Report 架构图】

▎核心能力速览

▸ 多Agent协作:研究、开发、执行等专业角色由编排层分工,复杂目标可以拆成多阶段任务

▸ 20+专业工具:官方README列出Nmap、Metasploit、SQLMap等常用渗透工具,并由Agent按任务调用

▸ 隔离执行:测试命令在Docker工作容器中运行,可按任务自动选择镜像

▸ 长期记忆:使用PostgreSQL + pgvector保存命令、输出、经验和上下文,支持后续检索复用

▸ Web与外部情报:内置隔离浏览器,并可接入Tavily、Firecrawl、Perplexity、Searxng等搜索系统

▸ 10+模型提供商:支持OpenAI、Anthropic、Gemini、Bedrock、Ollama、DeepSeek、GLM、Kimi、Qwen、MiniMax及自定义兼容接口

▸ 完整API:提供REST和GraphQL接口,可通过Bearer Token接入现有安全流程

💡 一句话理解

PentAGI = 渗透测试编排器 + 专业Agent团队 + Docker工具沙箱 + 向量记忆 + 报告与可观测平台。

它不是简单问模型“这里有什么漏洞”,而是让模型在授权环境里围绕证据持续行动。

▎边界也要说清楚

官方README专门列出了当前能力边界:PentAGI不是CALDERA式的BAS或预定义攻击活动平台;由Agent自动生成固定攻击脚本仍属于概念或未来方向。当前Flow报告支持网页查看、复制、Markdown和PDF下载,没有把JSON报告导出写成已支持能力。

02 测试成绩

一次公开灰盒基准,结果比宣传更值得看

PentAGI官方README没有公布统一比赛名次或通用成功率。为避免用功能数量冒充战绩,这里引用Escape在2026年4月30日发布的第三方对比基准,只保留两项可核验的PentAGI实测成绩。

测试目标是故意包含20个已知漏洞的Duck Store,覆盖注入、身份认证、访问控制、XSS和业务逻辑等问题。测试采用灰盒条件:提供目标地址、OpenAPI文档与两组账号,不提供源码;PentAGI使用DeepSeek v3.2,结果只统计能证明实际利用或给出清晰PoC的发现。

实测指标

成绩

测试口径

确认漏洞

9/20(45%)

Duck Store单次灰盒测试;只计确认利用或具备可复现PoC的结果

误报率

10%

测试方对高危/中危发现统计的False Positive Rate

▎这组数字该怎么读?

45%不是“PentAGI在所有项目上的平均检出率”,而是特定版本、特定模型、特定提示与特定靶场下的一次结果。测试文章认为,这次运行在注入和IDOR方面表现较强,但漏掉了XSS和部分访问控制问题。

另一个值得注意的点是:同样使用DeepSeek v3.2的不同工具成绩差异很大。这说明自动渗透系统的关键不只在模型,还在Agent循环、工具调用、身份认证处理和上下文管理。

📌 测试边界

该基准由商业安全厂商Escape发布,测试方本身也是对比产品之一,阅读时应保留利益相关方视角。

每个工具只运行一次,结果没有多轮取平均;文章也明确称其为2026年4月初能力的时间点快照。

所以这两项成绩适合判断当时的能力形态,不适合直接推导生产环境效果。

【配图:Duck Store基准结果表 / PentAGI两项成绩信息图】

03 使用场景

它能帮安全团队做什么?

PentAGI更适合把它当作一套可监督的自动化测试平台,而不是替代安全工程师的“万能黑客”。它擅长接住目标明确、允许反复试探、过程需要留痕的授权任务。

▎🛡️ 场景一:内部资产与应用的授权评估

在企业自有测试环境中,可以让PentAGI围绕指定域名、API或服务做信息收集、弱点验证与证据整理。Agent负责重复工作,人负责划定范围、审核动作和确认风险。

▸ 新系统上线前的安全回归与攻击面补充检查

▸ 内部API、管理后台和测试网段的授权弱点验证

▸ 把发现、命令、回显和报告集中保存,减少手工整理成本

▎🔍 场景二:Web与API灰盒测试

给出OpenAPI文档、测试账号和明确范围后,Agent可以围绕认证、授权、输入校验和业务流程连续尝试。第三方Duck Store基准正是这种灰盒用法,也暴露了当前系统在不同漏洞类型上的能力差异。

▎🧪 场景三:靶场、培训与安全研究

在本地靶场、CTF练习环境或专门搭建的脆弱应用中,PentAGI可以用于观察Agent如何规划任务、选择工具和修正路线。配合Langfuse与Grafana,还能比较不同模型、提示和工具策略的影响。

▎🔗 场景四:接入现有自动化流程

REST与GraphQL API让团队可以把PentAGI接到工单、资产平台或安全运营流程里。更稳妥的方式是让外部系统创建受控任务、读取状态与报告,再由人工决定是否进入修复或复测。

【配图:授权评估 / API灰盒 / 靶场研究 / 流程集成四象限】

04 部署教程

先在隔离环境里跑起来

官方推荐使用交互式安装器,它会检查Docker、配置模型与搜索服务、生成安全凭据并启动Compose。下面同时给出Linux安装器方式和手动Docker Compose方式。

▎环境要求

▸ Docker与Docker Compose,或按官方文档配置Podman

▸ 至少2 vCPU、4GB内存、20GB可用磁盘

▸ 可访问容器镜像与模型服务的网络

▸ 至少配置一个LLM提供商;外部搜索API为可选项

▎方式一:官方安装器(Linux amd64)

mkdir -p pentagi && cd pentagi
wget -O installer.zip https://pentagi.com/downloads/linux/amd64/installer-latest.zip
unzip installer.zip
sudo ./installer

Windows、macOS以及Linux arm64也有对应安装包,建议始终从PentAGI官方地址下载,并根据实际CPU架构选择版本。

▎方式二:手动Docker Compose

mkdir pentagi && cd pentagi

curl -o .env https://raw.githubusercontent.com/vxcontrol/pentagi/master/.env.example
curl -o example.custom.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/custom-openai.provider.yml
curl -o example.ollama.provider.yml https://raw.githubusercontent.com/vxcontrol/pentagi/master/examples/configs/ollama-llama318b.provider.yml

编辑.env,至少填入一种模型凭据。云端模型可配置OPEN_AI_KEY、ANTHROPIC_API_KEY或GEMINI_API_KEY;本地模型可配置OLLAMA_SERVER_URL与OLLAMA_SERVER_MODEL。

# 示例:至少选择一种,不要把真实密钥提交到Git
OPEN_AI_KEY=your_openai_key

# 或使用本地Ollama
OLLAMA_SERVER_URL=http://localhost:11434
OLLAMA_SERVER_MODEL=your_model_name

▎启动并首次登录

curl -O https://raw.githubusercontent.com/vxcontrol/pentagi/master/docker-compose.yml
docker compose up -d

# 排查启动问题
docker compose logs -f pentagi

浏览器访问 https://localhost:8443。官方默认管理员账号为 admin@pentagi.com / admin,第一次登录后必须立即修改默认密码。

💡 上线前建议

默认只监听127.0.0.1。需要远程访问时,应配置真实PUBLIC_URL、CORS_ORIGINS、TLS与访问控制,不要直接裸露服务。

生产环境优先采用官方推荐的双节点架构,把执行工作容器放到独立Worker节点。

在跑完整Flow前,可先用镜像内的ctester验证模型的函数调用、JSON输出和安全知识能力。

⚠️ 风险警示

让AI跑命令之前,先把边界锁死

⚠️ 只用于明确授权的目标

PentAGI只能用于你拥有或已获得书面授权的系统、靶场和研究环境。

任务提示、网络路由和账号权限都应限定范围,避免Agent访问非目标资产。

⚠️ Docker权限不是普通权限

官方Compose为了管理工作容器,会以root运行并访问Docker socket;拿到宿主Docker API通常等同拿到宿主机高权限。

生产环境不要把宿主Docker socket直接交给Agent,优先使用独立Worker与加固的Docker-in-Docker TLS端点。

⚠️ 保护密钥、附件和测试数据

不要把真实API Key、生产账号、客户数据或未公开漏洞信息提交到仓库或上传给不受控的第三方模型。

为模型、搜索服务和Worker配置最小权限、出站限制、日志审计与独立凭据。

💬 写在最后

自动化渗透的关键,不只是模型更聪明

PentAGI最有价值的地方,是把“模型思考”变成了一条可执行、可观察、可保存的安全测试链路。它让Agent能够真正调用工具、读取结果、调整策略,而不是停在聊天窗口里给几条建议。

但第三方基准也提醒我们:会跑工具不等于覆盖全面。一次测试里,它能确认9个漏洞,也会漏掉另外11个。自动化系统可以扩展工程师的手脚,却还不能替代范围控制、证据复核和专业判断。

更现实的用法,是把PentAGI放在隔离、授权、可审计的环境中,让它承担重复探索与证据收集,再由人决定哪些发现成立、哪些动作可以继续。

▎互动提问

看完这篇,聊聊你的看法:

▸ 你会更关注AI渗透工具的检出率、误报率,还是过程可审计性?

▸ 如果把PentAGI接入企业流程,你认为最先该自动化哪一步?

▸ 面对Docker高权限和模型数据外发,你会怎样设计隔离边界?

欢迎在评论区聊聊!觉得有用的话,点赞 + 在看 + 转发三连支持一下~

🔒 关注我,持续分享网安圈硬核干货

项目地址:https://github.com/vxcontrol/pentagi

实测来源:https://escape.tech/blog/benchmarking-agentic-ai-pentesting-tools/

资料来源:GitHub README(vxcontrol/pentagi,访问于2026-08-05);Escape《Benchmarking AI Pentesting Tools: A Practical Comparison》(2026-04-30)。

(内容由AI生成,仅供参考)

posted on 2026-08-05 22:26  智能化态势感知  阅读(53)  评论(0)    收藏  举报

导航