在上一篇《同一份 PRD,国内 Work Agent 为什么交出了不同的 MVP?》 验证基础上,本次继续围绕《城市分时电价观察站 MVP 需求文档》,对国外 Work Agent 进行同样的实践验证。
本轮选择:
-
• Claude Work;
-
• ChatGPT Work(Codex);
-
• Gemini。
其中,Claude Work 和 ChatGPT Work(Codex)均通过统一模型环境进行验证,Gemini 因模型切换配置未完成,未形成有效测试结果。
通过同一份 PRD、相同验证方式和真实 MVP 开发过程,进一步了解国外 Work Agent 在实际任务中的表现。
完整验证结果和交付页面已同步发布到 GitHub。
国外 Work Agent 验证总览图
01 实验环境
本轮实验保持与上一篇一致,采用相同 PRD 和验证方式。
模型:DeepSeek-v4-flash。
接入方式:
-
• 使用 CC-Switch 进行模型路由与协议转换;
-
• 通过 API 接入 DeepSeek;
-
• Token 消耗通过 DeepSeek 后台统计。后台展示为累计用量,各 Agent Token 消耗根据对应验证阶段前后累计值计算
02 Claude Work 实测结果
Claude Work 本轮基本完成了一次完整 MVP 交付,首次生成耗时约 50 分钟,人工检查发现部分业务逻辑偏差,本轮未继续要求 Agent 进行二次修改。
从 PRD 到最终页面,完成:
-
• Web 页面;
-
• CSV 数据加载;
-
• SQLite 数据结构;
-
• 数据说明文档。

Claude Work 概览页面
从实际验收结果看,大部分功能符合预期,但仍存在部分业务理解偏差:
-
• 顶部菜单主要用于页面定位,并非完整查询入口;
-
• 省份过滤能力不完整;
-
• 当前主要展示夏季工业用电数据。
资源消耗:
通过 DeepSeek 后台用量统计:
-
• API 请求次数:约 81 次;
-
• Token 消耗:约 1005 万。
03 ChatGPT Work(Codex)实测结果
ChatGPT Work(Codex)首次版本约 15 分钟完成。初始交付包括:
-
• Web 页面;
-
• CSV 数据;
-
• SQLite 建库脚本;
-
• 数据导入程序;
-
• 配置文件;
-
• README 和限制说明。
但首次版本数据加载不出来,后续进行了多轮交互修复。
主要问题包括:
-
• CSV 数据加载异常;
-
• 页面脚本运行错误;
-
• 外部资源加载问题;
-
• 页面结构与脚本逻辑不一致。
经过 5 轮交互后,最终完成可运行版本。

ChatGPT Work 最终页面
交付周期
首次版本:约 15 分钟。初版数据加载不出来,经过多轮问题定位和修复:
最终耗时:约 90 分钟。
资源消耗
通过 DeepSeek 后台用量统计:
-
• API 请求次数:约 145 次;
-
• Token 消耗:约 1922 万;
04 小结

DeepSeek后台流量统计
通过本轮真实 MVP 开发验证,可以看到:
当前 Work Agent 已经具备完成从需求理解到应用交付的大部分能力。
但在实际任务中,最终交付效率并不只取决于首次生成速度。
本轮两个 Agent 均使用相同模型环境,但交付过程存在明显差异:
-
• Claude Work 首次交付耗时约 50 分钟,人工验收后未进入多轮交互修改流程;
-
• ChatGPT Work(Codex)首次版本约 15 分钟完成,但由于数据加载、页面运行等工程问题,经过 5 轮交互后,最终耗时约 90 分钟。
从本次验证结果看,模型提供基础能力,而 Agent 自身的任务规划、工具调用、上下文管理和验证机制,会直接影响最终交付质量。
更佳阅读效果,请移步关注我的公众号

浙公网安备 33010602011771号