DeepSeek V4 Pro 正式版来了:DeepSWE 暴涨近 5 倍,Codex 一条命令直连

大家好,我是老张。

先问个扎心的问题:你让 AI 写代码的时候,它到底是在"干活",还是在"表演干活"?

老张自己的体验是,很多模型聊天挺溜,一让它改个真实仓库、跑个完整流程,就开始露馅——不是漏了边界条件,就是把接口参数搞错,最后还得自己吭哧吭哧修到凌晨。

所以判断一个 Agent 强不强,别听它吹,得看它在真实软件工程基准上的分数。今天 DeepSeek V4 Pro 正式版上线,恰好最值得看的就是这块。


一、发生了什么

一句话:deepseek-v4-pro 模型版本更新为 DeepSeek-V4-Pro-0813,调用方式完全不变。

对,还是那个模型名 deepseek-v4-pro,你的代码一行不用改,就能自动用上最新版本。老张最烦的就是换个版本还得改一堆配置,这次官方干得挺利索。

顺带说一句,deepseek-v4-flash 也更新到了 DeepSeek-V4-Flash-0731,同样调用不变。之前 Flash 正式版上线时老张聊过它原生支持 Codex,这次 Pro 也跟上了。


二、性能到底涨了多少

别的不扯,直接上官方 Agent 基准测试的数(DeepSeek-V4-Pro-0813 vs 预览版):
img_v3_0214h_ea91e157-f3d1-486d-8e0a-2b022269109g

基准 预览版 V4-Pro-0813 提升 Fable 5
DeepSWE 12.8 62.7 +49.9 70.0
DSBench-Hard 31.1 67.2 +36.1 68.3
Cybergym 52.7 83.3 +30.6 83.1
DSBench-FullStack 41.8 71.1 +29.3 77.2
NL2Repo 38.5 61.5 +23.0
AutomationBench 12.8 31.8 +19.0 29.1
Toolathlon-Verified 55.9 74.1 +18.2 77.9
Terminal Bench 2.1 72.1 87.9 +15.8 88.0
Agents' Last Exam 16.5 25.7 +9.2
HLE 37.7 42.7 +5.0 53.3

这张表看两件事就够了。

第一,正式版 vs 预览版,全面碾压。 十项基准里没有一项倒退,最猛的三项——DeepSWE 涨了近 5 倍(12.8→62.7)、DSBench-Hard 翻了一倍多(31.1→67.2)、Cybergym 涨 30 分(52.7→83.3)。最扎眼的是 DeepSWE,这是个考验“长周期、高复杂度真实软件工程”的基准,预览版只有 12.8 分,正式版直接干到 62.7。这个数字意味着它不是“会做选择题”,而是真的能在复杂代码仓库里把活干完。

第二,跟 Claude Fable 5 的差距,从“被碾压”缩到了“贴身肉搏”。 老张实话实说:Fable 5 在 HLE、DeepSWE、Toolathlon、DSBench 这几项还是领先的,V4 Pro 没有全面反超。但有两个亮点——Cybergym 83.3 跟 Fable 5 的 83.1 基本持平,AutomationBench 31.8 直接反超了 Fable 5 的 29.1。对一款国产模型来说,这已经是能上桌掰手腕的水平了。

对运维和开发者来说,还多了几个实用的能力:支持 JSON 结构化输出、工具调用、Responses API 和 Anthropic API 格式。换句话说,你能用它接更多现成的 Agent 框架和工具链。

老张提醒一句:基准测试反映的是特定评测设置下的表现,实际效果还看任务类型、提示词和推理预算。分数是参考,不是承诺。


三、Pro 原生支持 Codex 了

这是老张觉得最实在的一点。

以前给 Codex 接国产模型,最大的坎是协议不兼容——Codex 走 OpenAI 的 Responses API,国产模型走 Chat Completions,两套东西对不上,你直接改 Base URL 大概率报 404,得在本机跑一层代理做协议翻译,麻烦不说还容易踩坑。

现在 DeepSeek V4 Pro 官方原生支持了 Responses API,意味着 Codex 可以直连 DeepSeek,中间那层代理可以省了。

官方直接给了一键脚本 codex-deepseek-setup.sh。跑起来之后是个菜单,现在你能看到:

Codex DeepSeek Setup v1.1.0
Codex 目录: /Users/xxx/.codex
请选择要执行的操作:
1. 修改 Codex 配置,使用 deepseek-v4-flash 模型
2. 修改 Codex 配置,使用 deepseek-v4-pro 模型
3. 恢复默认的 Codex 配置(删除 deepseek 相关配置)

注意选项 2——deepseek-v4-pro 已经能选了。在这之前,官方文档里明确写着"当前只有 Flash 支持 Codex,Pro 预计 8 月初支持",现在这个"预计"落地了。

脚本会帮你写好 ~/.codex/models.jsonconfig.toml,输入 API Key 回车就行。想切换模型再跑一遍,想还原选 3。脚本地址在 DeepSeek 官方文档的「Agent 工具接入指南」里,直接去复制即可。

老张实测建议:跑之前先确认 Codex CLI 或桌面端至少启动过一次,让它生成好 ~/.codex 目录;另外脚本会动你的 config.toml,如果你原来配过 plugins、MCP 或项目信任,记得先备份一下。


四、老张怎么看

几点实话:

1. 这次更新最值钱的不是跑分,是落地。
DeepSWE 涨近 5 倍 + 原生 Codex,说明 DeepSeek 在"让 Agent 真干活"这条路上是动真格的,不是刷个 MMLU 就完事。

2. 免中转代理,省的是维护成本。
少一层代理,就少一个会挂的环节。对个人和小团队来说,这事儿的价值不亚于模型变聪明。

3. 价格还没定,别急着下结论。
官方目前还没公布 V4 Pro 的 API 定价,此前也预告过近期会整体调整定价。想上生产的,建议先关注官方正式通知,别拿现在的价格当长期承诺。

4. 网页端和 API 端有差异的反馈。
社区里有网友提到网页端和 API 调用出来的思维链表现有差异,API 输出的话术偏生硬。如果你觉得 API 效果不对劲,可以留意下这个点,等官方后续优化。


五、适合谁用

场景 推荐程度
用 Codex 写代码、想换国产模型的 ⭐⭐⭐⭐⭐
搞 Agent 自动化、工具调用的开发者 ⭐⭐⭐⭐⭐
对成本敏感的中小团队 ⭐⭐⭐⭐
需要极低延迟的实时交互场景 ⭐⭐⭐(并发上限 500,低于 Flash 的 2500)

六、资源


聊聊你的方案

评论区见:

  1. 你现在写代码用哪个模型当主力? DeepSeek、还是别的?
  2. 给 Codex 接国产模型,你踩过协议不兼容的坑吗?
  3. 如果 AI 能再帮你干一件事,你最希望是什么?

老张先说:我挺期待 DeepSWE 这种"真实工程"基准以后能更普及——跑分吹得再响,都不如看它能不能把一个真实仓库从头改到尾。

你怎么看?留言区聊聊。

posted @ 2026-08-13 09:15  厚德载物_VIP  阅读(417)  评论(2)    收藏  举报