DeepSeek V4-Pro闪电二连击:国产大模型正在改写什么规则
关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集
没有发布会,没有预告,它悄悄上线了——然后整个行业都睡不着了
大家好,我是某互联网公司的技术架构负责人。
上周三凌晨,团队群里突然弹出一条消息,附带一个链接:
“兄弟们,DeepSeek V4 Pro正式版上线了。没有发布会,没有预告,就是API文档里悄悄改了版本号。”
我点开看了一眼——DeepSeek-V4-Pro-0813。然后又看了一眼定价页——缓存命中输入0.025元/百万Token,输出6元/百万Token。接着往下翻,看到了一个让我彻底清醒的数字:DeepSWE从预览版的12.8飙到62.7,涨了将近5倍。
我关上手机,睡不着了。
一、它“转正”的方式,本身就是一种态度
先说说这次发布有多低调。
8月12日深夜,DeepSeek没有开发布会,没有官宣推文,只是在API文档和定价页里把模型版本号从Preview改成了DeepSeek-V4-Pro-0813。老用户什么都不用改,后端已经悄悄换成了新版。
同一天晚上,马斯克的Grok 4.6也在抢头条,两件事撞在一起,被媒体戏称为“梁文锋对垒马斯克”。
但我想说的是另一件事——这不是一个新模型,是转正。
今年4月24日,DeepSeek发布了V4系列预览版,Pro版当时还是Preview状态。三个多月后,正式版才来。这期间,行业里发生了太多事——Claude Fable 5发布了、GPT-5系列迭代了好几轮、各家大模型打得不可开交。DeepSeek在这三个月里没有发新版本,而是在打磨同一个模型。
然后在一个没有预兆的深夜,静默上线。
这种“不开发布会、不抢头条、产品说话”的风格,本身就是对行业规则的一种改写。
二、参数没变,但能力翻了5倍
先看硬参数。
DeepSeek-V4-Pro正式版:总参数1.6T(1.6万亿),激活参数49B。上下文100万Token,输出上限384K Token。支持thinking和non-thinking双模式,默认开启思考模式。接口同时兼容OpenAI和Anthropic两套格式。
参数和预览版一样。但能力完全不一样了。
最夸张的数字来自Agent相关评测:
基准测试
预览版
正式版
提升
DeepSWE
(软件工程)
12.8
62.7 +49.9
Terminal Bench 2.1
(终端操作)
72.1
87.9
+15.8
Cybergym
(网络安全攻防)
52.7
83.3
+30.6
NL2Repo
(自然语言转代码仓库)
38.5
61.5
+23.0
DSBench-FullStack
(全栈开发)
41.8
71.1
+29.3
数据来源:
DeepSWE从12.8跳到62.7。这项基准测的不是“会不会写一段代码”,而是 “能不能像工程师一样持续干活” 。12.8分是“写个Demo还行”,62.7分是“能独立完成一个完整任务”。差了将近5倍。
在Terminal Bench 2.1上,V4 Pro拿到87.9分,逼近Claude Fable 5的88.0分,只差0.1分。在Cybergym(网络安全智能体评测)和AutomationBench(高难度智能体评测)上,甚至反超了Fable 5。
参数没变,能力翻了5倍——这意味着什么?
意味着DeepSeek在后训练(post-training) 上下了狠功夫。同样的骨架,换了一套训练方法,直接把模型从一个“会答题的学生”变成了“能干活的人”。
官方的叙事也换了一个词——不再强调“更会答题”,而是强调“更会把一件事干完”。
人工智能技术学习交流群
伙伴们,对AI测试、大模型评测、质量保障感兴趣吗?我们建了一个 「人工智能测试开发交流群」,专门用来探讨相关技术、分享资料、互通有无。无论你是正在实践还是好奇探索,都欢迎扫码加入,一起抱团成长!期待与你交流!👇

三、六十分之一的价格,改写的是什么规则?
价格,是这次V4 Pro正式版最锋利的武器。
官方定价:输入(缓存未命中)3元/百万Token,输出6元/百万Token,缓存命中输入低至0.025元/百万Token。
放海外一比,差距是数量级的:Fable 5输出约360元/百万Token,V4 Pro的6元正好是它的六十分之一。对比Opus 5(约180元)是三十分之一。对比国内竞品Kimi K3(100元)是零头。
有博主算过一笔账:每天把几百段代码丢给模型做review,假设一天烧20万输出token,用Fable 5要72元,换成V4 Pro只要1.2元——一个月差两千多块,一年差出一辆二手电驴。
但价格的故事没这么简单。
官方已经在定价页挂出预告:“计划近期整体上调DeepSeek API服务定价,预计涨幅较大”。随后引入了峰谷计费——高峰期(9:00-12:00、14:00-18:00)价格翻倍甚至更多。
8月17日调价生效后:
计费项
调价前
空闲时段
高峰时段
输入(缓存未命中)
3元
4.5元
9元
输出
6元
13.5元
27元
输入(缓存命中)
0.025元
0.15元
0.3元
数据来源:
高峰时段输出从6元涨到27元,涨幅350%。缓存命中输入从0.025元涨到0.3元,涨幅1100%。
所以V4 Pro到底在改写什么规则?
第一,它证明了中国模型能在性能上逼近全球最前沿——Terminal Bench只差0.1分,部分基准甚至反超。
第二,它用六十分之一的价格,重新定义了“性价比”这三个字。
第三,也是最重要的一点——DeepSeek不再只是“价格屠夫”了。 它在性能上已经站到了全球第一梯队,然后才谈价格。顺序很重要——先有实力,再谈性价比。这才是真正的规则改写。
四、国产算力生态:从“备胎”到“主力”
这次V4 Pro还有一个被很多人忽略的信号——国产算力生态的成熟。
V4系列发布当天,华为昇腾就完成了首发适配。寒武纪等7家国产芯片也实现了高效适配。昇腾A2、A3及950全系列产品全面支持V4-Flash和V4-Pro。
基于V4-Pro模型,在8K输入场景,昇腾950超节点可实现TPOT约20ms时单卡Decode吞吐4700TPS。
DeepSeek V4是第一个在华为昇腾NPU上完成首发的万亿参数级大模型。它全程基于华为昇腾等国产AI芯片进行训练和推理。
英伟达从AI算力的必选项,变成了众多可选项之一。
这改写的是整个产业链的规则——中国AI不再只有“用别人的芯片、跑别人的生态”这一条路。
五、关于涨价:一个不得不说的“但是”
最后说一个很多人关心的问题——涨价。
V4 Pro正式版上线后第5天(8月17日),DeepSeek启动了API调价。高峰时段价格涨了好几倍,缓存命中输入涨幅甚至达到1100%。
有媒体用“梁文锋不想当'价格屠夫'了”来做标题。
但换个角度想:如果V4 Pro的性能真的逼近Fable 5,价格只有它的几十分之一,那这个价格本身就不可持续。 6元/百万Token的输出价格,在算力成本面前,更像是战略补贴——先把用户拉过来,再慢慢调价到合理水平。
涨价之后,V4 Pro仍然是全球性价比最高的旗舰模型之一。只是从“白菜价”变成了“正常折扣价”。
或者说——它终于开始按自己的真实价值定价了。
最后
DeepSeek V4 Pro的“闪电二连击”——4月预览版开源、8月正式版转正——正在改写至少四条规则:
第一,性能规则。 中国模型在Agent和代码能力上,已经逼近全球最前沿。DeepSWE从12.8到62.7,不是渐进式进步,是代际跨越。
第二,价格规则。 六十分之一的价格,让“顶尖性能=天价”这个等式不再成立。
第三,算力规则。 华为昇腾、寒武纪等国产芯片全面适配,英伟达不再是唯一选项。
第四,发布规则。 没有发布会、没有预告、静默上线——用产品说话,而不是用PPT说话。
有媒体在报道里写了一句很到位的话:
“DeepSeek V4不是最强的,但它或许是最重要的。”
因为它证明了一件事:中国大模型不需要靠“追赶”的姿态活着。它可以站到第一梯队,然后用自己定义的方式参与竞争。
这才是V4 Pro真正改写的东西。
推荐学习
智能化测试-测试用例生成公益训练营,从行业大模型特性讲起,带你搞懂AI测试的全链路:大模型能力评测、智能体Harness工程、Skill技能体系、CLI与MCP工具体系、RAG知识图谱——最后直接上手打造一个能自动生成测试用例的智能体。

关于我们
霍格沃兹测试开发学社,隶属于 测吧(北京)科技有限公司,是一个面向软件测试爱好者的技术交流社区。
学社围绕现代软件测试工程体系展开,内容涵盖软件测试入门、自动化测试、性能测试、接口测试、测试开发、全栈测试,以及人工智能测试与 AI 在测试工程中的应用实践。
我们关注测试工程能力的系统化建设,包括 Python 自动化测试、Java 自动化测试、Web 与 App 自动化、持续集成与质量体系建设,同时探索 AI 驱动的测试设计、用例生成、自动化执行与质量分析方法,沉淀可复用、可落地的测试开发工程经验。
在技术社区与工程实践之外,学社还参与测试工程人才培养体系建设,面向高校提供测试实训平台与实践支持,组织开展 “火焰杯” 软件测试相关技术赛事,并探索以能力为导向的人才培养模式,包括高校学员先学习、就业后付款的实践路径。
同时,学社结合真实行业需求,为在职测试工程师与高潜学员提供名企大厂 1v1 私教服务,用于个性化能力提升与工程实践指导。

浙公网安备 33010602011771号