博客园  :: 首页  :: 联系 :: 管理

同一份 PRD,国外 Work Agent 表现如何?

Posted on 2026-08-14 18:56  天戈朱  阅读(6)  评论(0)    收藏  举报

在上一篇《同一份 PRD,国内 Work Agent 为什么交出了不同的 MVP?》 验证基础上,本次继续围绕《城市分时电价观察站 MVP 需求文档》,对国外 Work Agent 进行同样的实践验证。

本轮选择:

  • • Claude Work;

  • • ChatGPT Work(Codex);

  • • Gemini。

其中,Claude Work 和 ChatGPT Work(Codex)均通过统一模型环境进行验证,Gemini 因模型切换配置未完成,未形成有效测试结果。

通过同一份 PRD、相同验证方式和真实 MVP 开发过程,进一步了解国外 Work Agent 在实际任务中的表现。

完整验证结果和交付页面已同步发布到 GitHub。图片
国外 Work Agent 验证总览图


01 实验环境

本轮实验保持与上一篇一致,采用相同 PRD 和验证方式。

模型:DeepSeek-v4-flash。

接入方式:

  • • 使用 CC-Switch 进行模型路由与协议转换;

  • • 通过 API 接入 DeepSeek;

  • • Token 消耗通过 DeepSeek 后台统计。后台展示为累计用量,各 Agent Token 消耗根据对应验证阶段前后累计值计算


02 Claude Work 实测结果

Claude Work 本轮基本完成了一次完整 MVP 交付,首次生成耗时约 50 分钟,人工检查发现部分业务逻辑偏差,本轮未继续要求 Agent 进行二次修改。

从 PRD 到最终页面,完成:

  • • Web 页面;

  • • CSV 数据加载;

  • • SQLite 数据结构;

  • • 数据说明文档。

图片
Claude Work 概览页面

从实际验收结果看,大部分功能符合预期,但仍存在部分业务理解偏差:

  • • 顶部菜单主要用于页面定位,并非完整查询入口;

  • • 省份过滤能力不完整;

  • • 当前主要展示夏季工业用电数据。

资源消耗:

通过 DeepSeek 后台用量统计:

  • • API 请求次数:约 81 次;

  • • Token 消耗:约 1005 万。


03 ChatGPT Work(Codex)实测结果

ChatGPT Work(Codex)首次版本约 15 分钟完成。初始交付包括:

  • • Web 页面;

  • • CSV 数据;

  • • SQLite 建库脚本;

  • • 数据导入程序;

  • • 配置文件;

  • • README 和限制说明。

但首次版本数据加载不出来,后续进行了多轮交互修复。

主要问题包括:

  • • CSV 数据加载异常;

  • • 页面脚本运行错误;

  • • 外部资源加载问题;

  • • 页面结构与脚本逻辑不一致。

经过 5 轮交互后,最终完成可运行版本。

图片
ChatGPT Work 最终页面

交付周期

首次版本:约 15 分钟。初版数据加载不出来,经过多轮问题定位和修复:

最终耗时:约 90 分钟。

资源消耗

通过 DeepSeek 后台用量统计:

  • • API 请求次数:约 145 次;

  • • Token 消耗:约 1922 万;


04 小结

图片
DeepSeek后台流量统计

通过本轮真实 MVP 开发验证,可以看到:

当前 Work Agent 已经具备完成从需求理解到应用交付的大部分能力。

但在实际任务中,最终交付效率并不只取决于首次生成速度。

本轮两个 Agent 均使用相同模型环境,但交付过程存在明显差异:

  • • Claude Work 首次交付耗时约 50 分钟,人工验收后未进入多轮交互修改流程;

  • • ChatGPT Work(Codex)首次版本约 15 分钟完成,但由于数据加载、页面运行等工程问题,经过 5 轮交互后,最终耗时约 90 分钟。

从本次验证结果看,模型提供基础能力,而 Agent 自身的任务规划、工具调用、上下文管理和验证机制,会直接影响最终交付质量。

更佳阅读效果,请移步关注我的公众号

tgzhu_公众号