DeepSeek V4 Pro 正式版来了:DeepSWE 暴涨近 5 倍,Codex 一条命令直连
大家好,我是老张。
先问个扎心的问题:你让 AI 写代码的时候,它到底是在"干活",还是在"表演干活"?
老张自己的体验是,很多模型聊天挺溜,一让它改个真实仓库、跑个完整流程,就开始露馅——不是漏了边界条件,就是把接口参数搞错,最后还得自己吭哧吭哧修到凌晨。
所以判断一个 Agent 强不强,别听它吹,得看它在真实软件工程基准上的分数。今天 DeepSeek V4 Pro 正式版上线,恰好最值得看的就是这块。
一、发生了什么
一句话:deepseek-v4-pro 模型版本更新为 DeepSeek-V4-Pro-0813,调用方式完全不变。
对,还是那个模型名 deepseek-v4-pro,你的代码一行不用改,就能自动用上最新版本。老张最烦的就是换个版本还得改一堆配置,这次官方干得挺利索。
顺带说一句,deepseek-v4-flash 也更新到了 DeepSeek-V4-Flash-0731,同样调用不变。之前 Flash 正式版上线时老张聊过它原生支持 Codex,这次 Pro 也跟上了。
二、性能到底涨了多少
别的不扯,直接上官方 Agent 基准测试的数(DeepSeek-V4-Pro-0813 vs 预览版):

| 基准 | 预览版 | V4-Pro-0813 | 提升 | Fable 5 |
|---|---|---|---|---|
| DeepSWE | 12.8 | 62.7 | +49.9 | 70.0 |
| DSBench-Hard | 31.1 | 67.2 | +36.1 | 68.3 |
| Cybergym | 52.7 | 83.3 | +30.6 | 83.1 |
| DSBench-FullStack | 41.8 | 71.1 | +29.3 | 77.2 |
| NL2Repo | 38.5 | 61.5 | +23.0 | — |
| AutomationBench | 12.8 | 31.8 | +19.0 | 29.1 |
| Toolathlon-Verified | 55.9 | 74.1 | +18.2 | 77.9 |
| Terminal Bench 2.1 | 72.1 | 87.9 | +15.8 | 88.0 |
| Agents' Last Exam | 16.5 | 25.7 | +9.2 | — |
| HLE | 37.7 | 42.7 | +5.0 | 53.3 |
这张表看两件事就够了。
第一,正式版 vs 预览版,全面碾压。 十项基准里没有一项倒退,最猛的三项——DeepSWE 涨了近 5 倍(12.8→62.7)、DSBench-Hard 翻了一倍多(31.1→67.2)、Cybergym 涨 30 分(52.7→83.3)。最扎眼的是 DeepSWE,这是个考验“长周期、高复杂度真实软件工程”的基准,预览版只有 12.8 分,正式版直接干到 62.7。这个数字意味着它不是“会做选择题”,而是真的能在复杂代码仓库里把活干完。
第二,跟 Claude Fable 5 的差距,从“被碾压”缩到了“贴身肉搏”。 老张实话实说:Fable 5 在 HLE、DeepSWE、Toolathlon、DSBench 这几项还是领先的,V4 Pro 没有全面反超。但有两个亮点——Cybergym 83.3 跟 Fable 5 的 83.1 基本持平,AutomationBench 31.8 直接反超了 Fable 5 的 29.1。对一款国产模型来说,这已经是能上桌掰手腕的水平了。
对运维和开发者来说,还多了几个实用的能力:支持 JSON 结构化输出、工具调用、Responses API 和 Anthropic API 格式。换句话说,你能用它接更多现成的 Agent 框架和工具链。
老张提醒一句:基准测试反映的是特定评测设置下的表现,实际效果还看任务类型、提示词和推理预算。分数是参考,不是承诺。
三、Pro 原生支持 Codex 了
这是老张觉得最实在的一点。
以前给 Codex 接国产模型,最大的坎是协议不兼容——Codex 走 OpenAI 的 Responses API,国产模型走 Chat Completions,两套东西对不上,你直接改 Base URL 大概率报 404,得在本机跑一层代理做协议翻译,麻烦不说还容易踩坑。
现在 DeepSeek V4 Pro 官方原生支持了 Responses API,意味着 Codex 可以直连 DeepSeek,中间那层代理可以省了。
官方直接给了一键脚本 codex-deepseek-setup.sh。跑起来之后是个菜单,现在你能看到:
Codex DeepSeek Setup v1.1.0
Codex 目录: /Users/xxx/.codex
请选择要执行的操作:
1. 修改 Codex 配置,使用 deepseek-v4-flash 模型
2. 修改 Codex 配置,使用 deepseek-v4-pro 模型
3. 恢复默认的 Codex 配置(删除 deepseek 相关配置)
注意选项 2——deepseek-v4-pro 已经能选了。在这之前,官方文档里明确写着"当前只有 Flash 支持 Codex,Pro 预计 8 月初支持",现在这个"预计"落地了。
脚本会帮你写好 ~/.codex/models.json 和 config.toml,输入 API Key 回车就行。想切换模型再跑一遍,想还原选 3。脚本地址在 DeepSeek 官方文档的「Agent 工具接入指南」里,直接去复制即可。
老张实测建议:跑之前先确认 Codex CLI 或桌面端至少启动过一次,让它生成好 ~/.codex 目录;另外脚本会动你的 config.toml,如果你原来配过 plugins、MCP 或项目信任,记得先备份一下。
四、老张怎么看
几点实话:
1. 这次更新最值钱的不是跑分,是落地。
DeepSWE 涨近 5 倍 + 原生 Codex,说明 DeepSeek 在"让 Agent 真干活"这条路上是动真格的,不是刷个 MMLU 就完事。
2. 免中转代理,省的是维护成本。
少一层代理,就少一个会挂的环节。对个人和小团队来说,这事儿的价值不亚于模型变聪明。
3. 价格还没定,别急着下结论。
官方目前还没公布 V4 Pro 的 API 定价,此前也预告过近期会整体调整定价。想上生产的,建议先关注官方正式通知,别拿现在的价格当长期承诺。
4. 网页端和 API 端有差异的反馈。
社区里有网友提到网页端和 API 调用出来的思维链表现有差异,API 输出的话术偏生硬。如果你觉得 API 效果不对劲,可以留意下这个点,等官方后续优化。
五、适合谁用
| 场景 | 推荐程度 |
|---|---|
| 用 Codex 写代码、想换国产模型的 | ⭐⭐⭐⭐⭐ |
| 搞 Agent 自动化、工具调用的开发者 | ⭐⭐⭐⭐⭐ |
| 对成本敏感的中小团队 | ⭐⭐⭐⭐ |
| 需要极低延迟的实时交互场景 | ⭐⭐⭐(并发上限 500,低于 Flash 的 2500) |
六、资源
- DeepSeek API 文档(首次调用):https://api-docs.deepseek.com/zh-cn/
- Codex 接入指南:https://api-docs.deepseek.com/quick_start/agent_integrations/codex
- 更新日志:https://api-docs.deepseek.com/zh-cn/updates
聊聊你的方案
评论区见:
- 你现在写代码用哪个模型当主力? DeepSeek、还是别的?
- 给 Codex 接国产模型,你踩过协议不兼容的坑吗?
- 如果 AI 能再帮你干一件事,你最希望是什么?
老张先说:我挺期待 DeepSWE 这种"真实工程"基准以后能更普及——跑分吹得再响,都不如看它能不能把一个真实仓库从头改到尾。
你怎么看?留言区聊聊。

浙公网安备 33010602011771号