DeepSeek V4 Pro 正式版、Grok 4.6 同夜发布
大家好,我是程序员天天困。
今早一觉醒来刷短视频,刷到个大消息:昨晚 DeepSeek V4 Pro 正式版和 Grok 4.6 撞一块儿发了——DeepSeek 官方定价页 MODEL VERSION 那一栏,悄悄从 Preview 换成了 DeepSeek-V4-Pro-0813;xAI 官博几乎同一时间挂出《Introducing Grok 4.6》。没开发布会,两家都挑了大半夜直接换节点、发博客。

这篇把两件事拆成四块讲:Pro 正式版跑到什么档位、Grok 4.6 升级了什么、价格差几倍、该怎么选。看完你再决定手上的 Agent 服务应该交给谁。
一、DeepSeek-V4-Pro-0813 转正:跑分拉满,但先别急着吹
先看确认到的事实。DeepSeek 官方定价页已经把模型版本号更新为 DeepSeek-V4-Pro-0813。

不过调用名仍然是 deepseek-v4-pro,base_url 和接口格式都没变——也就是说,存量代码不用动一行,请求已经走到新节点上了。

DeepSeek-V4-Pro-0813:DeepSeek V4 旗舰的正式版(GA),1.6T 总参、49B 激活的大规模混合专家模型,上下文窗口 1M token,主打高难度推理、全代码库分析和长程 Agent 任务。你可以把它理解为 DeepSeek 这套"满血发动机"的正式调校版。
功能上,Pro 正式版把 Flash 早就有的那套都补齐了:JSON 结构化输出、工具调用、Responses API、Anthropic API、Chat Prefix Completion,FIM 补全只在非思考模式下开放。最大输出 384K,并发限制 500(Flash 是 2500)。
跑分是这次最热闹的部分。DeepSeek 还放了张 Agent 对照表,10 项新测全集中在 Agent 场景,都是官方自测口径:
- Terminal-Bench 2.1:87.9%
- CyberGym:83.3%
- Toolathlon-Verified:74.1%
- DSBench-FullStack:71.1%
- DSBench-Hard:67.2%
- DeepSWE:62.7%
- NL2Repo:61.5%
- HLE(带工具):60.0%
- AutomationBench:31.8%
- Agents' Last Exam:25.7%

这张是 DeepSeek 官方放出来的对照表,好处是能直接看到 0813 和 Opus-4.8、Fable 5 在同一口径下的横向差距。逐项看的话,0813 其实不只是"接近"——Cybergym 83.3 比 Fable 5 的 83.1 高了 0.2,DeepSWE 62.7 比 Opus-4.8 的 58.0 高了近 5 分,HLE 带工具 60.0 也高于 Opus-4.8 的 57.9,Terminal-Bench 87.9 比 Opus-4.8 的 85.0 高了近 3 分。DeepSWE 从预览版的 12.8 直接拉到 62.7,是这次涨幅最大的一项。
但"接近 Fable 5"这个说法得拆开看。Terminal-Bench 87.9 对标的是表里 "Fable 5 (w/ fallback)" 那一列的 88.0,确实只差 0.1;可换几个基准差距就出来了:Toolathlon-Verified 74.1 比 Fable 5 的 77.9 低 3.8,DSBench-FullStack 71.1 比 Fable 5 的 77.2 低 6.1,DeepSWE 62.7 比 Fable 5 的 70.0 低 7.3。如果拿第三方平台上的全局最佳来比,差距更大——benchlm 显示 Toolathlon-Verified 最高是 Claude Opus 5 的 80.6,DeepSWE 最高是 GPT-5.6 Sol 的 72.7。

另外 SWE-bench Verified、GPQA 这些通用基准 DeepSeek 这次没重新测,沿用的还是 4 月预览版技术报告的数字。第三方综合分也能说明位置:Artificial Analysis 给 V4 Pro 0813(Max Effort)的智能指数是 53,在 605 个模型里排第 23,比 Grok 4.6、GPT-5.6 Sol 的 61 低 8 分,比 Fable 5 Max 的 62 低 9 分——这是九项基准加权后的独立测评,比单看一项跑分靠谱。

所以这张成绩单,单看 Agent 跑分确实猛,甚至几项超过了上一代 Opus-4.8,但和 Fable 5 是有输有赢,离第三方榜单上的全局最佳(Opus 5、GPT-5.6 Sol)也还有差距——"接近 Fable 5"是挑了最接近的一项说,不是全面追平。
二、Grok 4.6:参数没堆,把后训练重做了一遍
Grok 4.6 的发布路径完全是另一种风格——Musk 7 月 28 日在 X 上预告"8 月 7 日左右",结果跳票到 8 月 12 日才由官博正式上线。

Grok 4.6:xAI(SpaceXAI)的前沿模型,据 Musk 在 X 上披露沿用 1.5T 参数规模,定位编码、Agent 任务和知识工作,上下文 500K token,支持文本和图像输入、纯文本输出,输出长度不设上限。
xAI 官博里最值得留意的一点是:这一版不是靠堆参数,而是做了比 4.5 更长的补充训练,用模型生成的推理和工程数据重做了 SFT 轨迹,再在知识工作、通用编码、内核优化、Web 开发、CAD 等一堆 Agent 环境里跑 RL。说白了,跟 DeepSeek Flash 正式版一个路数——同一副身板,把后训练推倒重来。
官方跑分(x.ai/news/grok-4-6):
| 基准 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 | 61.3% | 56.6% | 60.6% | 63.6% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
AA 智能指数 61,追平 GPT-5.6 Sol,只比 Fable 5 Max 低 1 分。但 Terminal-Bench 26% 这个数偏低,和 DeepSeek Pro 0813 的 87.9% 不能直接比——两边版本号(v3.0 vs v2.1)、测试口径都不一样,别被数字落差带节奏。

在哪能用:Grok 4.6 已经是 Cursor 和 Grok Build 的默认模型,首周给 2 倍赠送额度;API 走 grok-4.6,OpenRouter、Vercel、Cloudflare 都能调。定价 $2/百万输入、$6/百万输出,缓存命中 $0.50;prompt 超过 200K 后翻倍到 $4/$12,还有个快两倍、价格也翻倍的 fast 变体。
三、两张价格表摆一起,差距比想象的大
把同夜发布的两个旗舰加上自家小弟 Flash 放一起看,价格差距比跑分差距扎眼多了(按每百万 token、美元计):
| 模型 | 上下文 | 输入(缓存未命中) | 输入(缓存命中) | 输出 | 并发 |
|---|---|---|---|---|---|
| DeepSeek V4 Pro 0813 | 1M | $0.435 | $0.003625 | $0.87 | 500 |
| DeepSeek V4 Flash 0731 | 1M | $0.14 | $0.0028 | $0.28 | 2500 |
| Grok 4.6(<200K) | 500K | $2.00 | $0.50 | $6.00 | — |
| Grok 4.6(≥200K) | 500K | $4.00 | $1.00 | $12.00 | — |
Pro 0813 的输出价只有 Grok 4.6 的七分之一左右,缓存命中价更是差了一百多倍。这还不是全部——DeepSeek 定价页脚注里挂了一句话:计划在近期整体上调 API 价格,"预计涨幅显著",具体以官方通知为准。Flash 上线时提过的峰谷定价还没落地,这次又加了一层整体涨价预警,长期跑生产的话,账单不能只按今天的数字算。

另外有个反馈值得留意:据智东西报道,X 上有开发者贴出对比,网页端和 API 端调同一个 0813 节点,思维链的说话风格差得挺明显,API 端话术偏生硬、语序别扭。DeepSeek 还没回应,如果你是把 Pro 直接面向 C 端输出,建议先灰度对比一轮。
可能有人会问:Pro 都正式版了,还有必要留 Flash 吗?
至少以 8 月中的口径,有。Flash 并发是 Pro 的 5 倍、输出价是 Pro 的三分之一,跑量的客服、检索、简单代码改写走 Flash 更划算;Pro 留给全代码库重构、长链路 Agent、1M 长文档这类真吃难度的任务。两家同夜发布也说明一件事:旗舰不再是"一个模型打天下",而是按难度和成本分层路由。
四、后端怎么接:模型名不变,但有两个坑要记
DeepSeek 这边切换成本几乎为零,base_url 和 model 名都不用改,后端已经自动切到 0813 节点:
from openai import OpenAI
client = OpenAI(api_key="sk-***", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "审查这段登录接口的鉴权逻辑"}],
)
print(resp.choices[0].message.content)
Grok 4.6 同样兼容 OpenAI 格式,但走 xAI 官方 base_url、推荐用 Responses API:
from openai import OpenAI
client = OpenAI(api_key="xai-***", base_url="https://api.x.ai/v1")
resp = client.responses.create(
model="grok-4.6",
input=[{"role": "user", "content": "把这个产品原型做成可交互的 React 页面"}],
)
print(resp.output_text)
两个坑记一下:一是 Grok 4.6 官方文档强烈建议设 prompt_cache_key(Chat Completions 用 x-grok-conv-id 头),不设的话多轮对话经常被路由到冷缓存服务器,缓存命中价形同虚设;二是 DeepSeek Pro 并发只有 500,做批量压测前记得提工单,别上线当晚才撞限流。
我的选型建议很直接:跑量任务继续 Flash,复杂 Agent 和长文档分析切 Pro 0813 试两周,需要把产品想法一步做成可交互前端、或者本来就在 Cursor/Grok Build 里干活的,Grok 4.6 值得花一周做对比。三家都按用量付费,切换成本就是一个 model 字段的事。
这一夜真正的信号不是谁跑分第一,而是旗舰模型的主战场已经从参数量挪到了后训练和单价——DeepSeek V4 Pro 正式版把价格压到 Grok 的七分之一,Grok 用 AA 61 分证明 1.5T 后训练也能摸到前沿。但两家官方自测的跑分都得先打个折,等 Artificial Analysis、终端基准和生产环境的第三方数据出来再下结论也不迟。
我是程序员天天困,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:DeepSeek V4 Pro 正式版 和 Grok 4.6 你打算先试哪个,还是继续等下半年的开源旗舰?

DeepSeek V4 Pro 正式版(0813)与 Grok 4.6 同夜上线。跑分、价格、选型一次讲清,帮你判断主力 API 要不要换
浙公网安备 33010602011771号