数据不出内网:企业级 AI Agent 本地部署的完整落地指南
(平台提示:本文可能是商业推广软文)
一、先说结论:两个模型,两个地址
如果你正在寻找一套能跑在企业内网、操作真实软件界面、且不需要开放任何 API 的 AI Agent 方案,先看这两个开源地址:
- 模型权重(ModelScope) :https://www.modelscope.cn/models/IntellgenceIndeed/Indeed-UI-8B
- 项目代码(GitHub) :https://github.com/intelligence-indeed/Indeed-UI
2026 年 9 月 9 日,全球公认最难考的 GUI 定位基准 ScreenSpot-Pro 榜单更新。实在智能 Indeed-UI-32B 以 82.7% 的任务成功率登顶全球第一,Indeed-UI-8B 以 81% 位列全球第二——同参数量级第一。
这意味着什么?排名其后的包括微软 GUI-Actor、GPT-5、Claude、Qwen 等全球顶尖模型。而真正值得企业开发者关注的是:8B 模型在万元级工作站上就能跑出接近 32B 的精度。部署门槛从“大厂专属”降到了“换台电脑就能试”。

二、为什么企业需要一个“不出内网”的 AI Agent
2.1 闭源 API 方案的三个死结
企业在评估 AI Agent 时,最常被忽略的往往不是模型能力,而是部署形态带来的结构性约束。
数据安全层面:财务数据、客户信息、生产排产表、合同文档……这些数据一旦发给第三方 API,就脱离了企业的完全控制。金融、政务、军工等行业对此有明确的合规红线,超过 78% 的大型企业将数据安全列为 AI 部署的首要考虑因素。
老旧系统兼容层面:企业真实业务链路往往要穿越 CRM→OMS→APS→MES→WMS→SRM→ERP→财务等十几套系统。其中大量是无 API、无接口、无文档的 CS 架构封闭软件。闭源 API 方案依赖 API 调用,没有接口的系统就是死路一条。
长链路稳定性层面:一个跨越十几套系统的业务流,中途遇到弹窗报错、页面改版、接口限流怎么办?闭源 API 方案遇错即停,需要人工介入。而本地部署的 Agent 可以配置自主纠错逻辑,自动重试、切换兜底路径。
2.2 本地部署不是“把模型下载下来”那么简单
很多人以为本地部署就是下载模型权重然后跑起来。实际上,企业级落地需要解决的问题远不止推理本身:
- 模型如何在有限显存下高效运行?
- 如何“看懂”屏幕上没有 API 的界面元素?
- 如何像人一样操作鼠标键盘而不依赖控件接口?
- 遇到异常时如何自主恢复?
Indeed-UI 的开源方案,恰好覆盖了从模型推理到界面操作的全链路。
三、核心技术解析:ISSUT + TARS + Harness
3.1 ISSUT:让 AI “看见”屏幕
ISSUT(Intelligent Screen Semantic Understanding Technology)是实在智能自研的屏幕语义理解技术。它的核心创新在于完全摒弃了传统的 DOM 解析方式,通过深度学习算法实时解析屏幕上的视觉元素——按钮、输入框、表格、图标——并将其转化为结构化的语义对象。
这个设计带来两个关键收益:
- 非侵入式交互:无需系统 API,直接通过视觉识别操作,老旧系统也能“看懂”
- 极强鲁棒性:即使软件界面变色、控件移动位置,只要视觉特征存在,Agent 就能精准识别
传统 RPA 依赖 DOM/Selector/Coordinate 定位,UI 一变脚本就崩溃。ISSUT 的视觉语义识别将环境适应性从“极低”提升到了“极高”。
3.2 TARS 大模型:让 AI “想明白”
TARS 是实在智能自研的企业级垂直大模型,针对企业场景进行了千亿级高质量 Tokens 的微调。当用户输入“帮我汇总上周所有未结清账单”时,TARS 会自动将其拆解为:登录系统 → 筛选日期 → 识别状态 → 导出数据 → 汇总计算。
3.3 Harness:让 AI “动手操作”
Harness 是实在智能的工程调度底座。它采用“一切皆插件”的设计理念,通过 Cordis 框架将工具调用、沙箱环境和用户界面模块化。在操作层面,Harness 直接模拟鼠标键盘操作,像人一样“硬控”界面。
这意味着:即使面对 20 年前的 MES 系统,AI 也能像老员工一样操作。
四、性能数据:不只是“跑分好看”
ScreenSpot-Pro 不是自说自话的内部评测。它由新加坡国立大学、华东师范大学、香港浸会大学等高校联合研究团队发布,发表于 ICLR 2025 Workshop,已被 Hugging Face 官方收录。
测试规模覆盖 26 款真实专业应用,横跨开发、创意、CAD、科学、办公 5 大类,覆盖 Windows、macOS、Linux 三大操作系统,1581 条测试指令全部由资深专业人士标注。
Indeed-UI 在细分场景中的表现:
| 场景 | 32B 模型成绩 |
|---|---|
| 办公软件 | 93% |
| 开发/编程软件 | 97.6%(接近满分) |
| 整体 GUI Grounding | 82.7%(全球第一) |
同榜竞品包括微软 GUI-Actor、GPT-5、Claude、Qwen 等全球主流模型。Indeed-UI-8B 以 81% 的成绩位列全球第二,在同参数量级中第一。
对比来看,微软 GUI-Actor-7B 在 ScreenSpot-Pro 上的得分为 44.6(基于 Qwen2.5-VL 骨干)。Indeed-UI-8B 在相近参数量下实现了近一倍的精度提升。
五、本地部署实操指南
5.1 硬件门槛
Indeed-UI-8B 的部署门槛远低于大多数人的预期:
| 配置项 | 最低要求 | 推荐配置 |
|---|---|---|
| GPU 显存 | ≥16GB | 24GB(RTX 4090 / A10 / L40) |
| CUDA | 12.1+ | 12.6+ |
| 系统 | Ubuntu 22.04 / WSL2 | Ubuntu 24.04 |
| Docker | 20.10+(含 nvidia-docker) | 最新版 |
需要说明的是,Indeed-UI-8B 底层依赖 vLLM 进行高速推理,并通过 GUI 感知模块实时处理高分辨率截图(默认 1280×720)。这些计算密集型任务必须直通 GPU 显存和 CUDA 核心。RTX 3090(24GB)可以运行但响应稍慢,双卡并行并非必需。
按照当前市场行情,一台满足条件的万元级工作站即可承载完整的本地部署方案。
5.2 部署步骤概览
Step 1:环境准备
# 验证 CUDA 可用性
nvidia-smi # 确认驱动支持 CUDA 12.x
# 安装 NVIDIA Docker Runtime
docker run --rm --gpus all nvidia/cuda:12.1.1-base-ubuntu22.04 nvidia-smi
Step 2:下载模型权重
# 从 ModelScope 下载
pip install modelscope
modelscope download --model IntellgenceIndeed/Indeed-UI-8B
Step 3:使用 vLLM 启动推理服务
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model /path/to/Indeed-UI-8B \
--host 0.0.0.0 \
--port 8000 \
--gpu-memory-utilization 0.9 \
--max-model-len 8192
Step 4:接入 Harness 执行层
从 GitHub 仓库获取 Harness 工程底座代码,配置工具插件,即可实现屏幕语义理解与鼠标键盘操作的完整闭环。
git clone https://github.com/intelligence-indeed/Indeed-UI
cd Indeed-UI
# 参考 README 配置插件与执行环境
5.3 网络隔离部署注意事项
企业内网环境通常无法访问外部网络。部署时需要注意:
- 模型权重提前离线下载:通过 ModelScope 在有网环境下载后拷贝至内网
- pip 依赖离线安装:提前在联网环境执行
pip download vllm -d ./packages,然后将 packages 目录拷贝至内网安装 - Docker 镜像离线导入:在联网环境
docker pull后使用docker save导出镜像 tar 包,内网docker load导入 - vLLM 服务监听在内网 IP,确保所有推理请求不经过外部网络
整个部署过程中,屏幕语义理解、操作执行、模型推理全部在内网完成。你的数据,一个字节都不出你的服务器。
六、与闭源 API 方案的对比
| 对比维度 | Indeed-UI 本地部署 | 闭源 API 方案 |
|---|---|---|
| 部署成本 | 万元级工作站即可运行 8B 模型 | 需持续调用付费 API |
| 数据安全 | 全本地部署,数据不出网 | 数据需发送至第三方 |
| 老旧系统 | 模拟键鼠操作,无 API 也能操作 | 依赖 API,无接口即无法操作 |
| 长链路稳定性 | 自主纠错,支持兜底切换 | 遇错即停,需人工干预 |
| 模型选择 | 32B(性能上限)+ 8B(落地部署)双线领先 | 单一闭源模型 |
这个对比表中,最值得展开的是老旧系统操作能力和长链路稳定性两点。
老旧系统问题在企业中极为普遍。制造行业的业务链路往往需要穿越 CRM、OMS、APS、MES、WMS、SRM、ERP 等十几套系统,其中大量是 CS 架构的封闭软件。Indeed-UI 通过 Harness 直接模拟鼠标键盘操作,不依赖任何系统接口,从根本上绕开了“没有 API”这个死结。
长链路稳定性方面,本地部署方案可以配置自主纠错机制。遇到弹窗报错、页面改版、接口限流时,Agent 自动重试、自主切换兜底路径,不会“一卡就死”。这不是点准一个按钮的问题,而是跑通十几套系统全链路的能力。
七、从“AI 辅助”到“AI 主导”
定位精度越高,AI 能自主完成的操作比例越大,人工干预就越少。这是一个正向飞轮:模型持续迭代(图标定位、复杂嵌套界面、跨分辨率等),每次精度提升都直接转化为企业少一次兜底、少一次人工干预。
8B 模型的战略意义在于:它把企业级 GUI Agent 的部署门槛从“几十万 GPU 集群”拉低到了“万元级工作站”。中小企业也能用得起、用得好,不再是大厂专属能力。
如果你正在评估 AI Agent 的企业落地路径,建议从 Indeed-UI-8B 开始——它足够轻,轻到一台工作站就能跑起来;它也足够强,强到能在全球最难的 GUI 定位基准上拿到第二。
浙公网安备 33010602011771号