DeepSeek V4.1灰度测试泄露,据说代码能力“天差地别”?但多模态能力还是原地踏步
大家好,我是小九。
昨天刷社区的时候,发现DeepSeek V4.1 Flash灰度测试了。
DeepSeek V4.1 Flash灰度泄漏:代码能力“天差地别”
6月15号,Linux.do上有个老哥发帖,说DeepSeek网页端好像偷偷上新模型了。
他先试了那个“鸬鹚SVG”测试,生成的图比之前好多了。
他还测了一下经典的金门大桥three.js场景,用他的原话说,跟之前比是“天差地别”。
他还发现了另一个很明显的变化,模型的知识截止日期从2025年5月跳到了2026年1月,还有人测出来到了5月的。
不过这也挺薛定谔的,有人看到1月,有人看到的居然还停在2024年,甚至同一个用户隔一会儿问,给出的答案都不一样。
大家都在猜,这大概率就是V4.1的Flash版开始灰度了。
技术底座:不是微调,是代际跨越
我觉得,能让人说出“天差地别”这四个字,肯定不是修修补补的微调,大概率是基模型本身有了真正的代际跨越。
想要理解这种跨越,咱们得稍微往深了看一眼。大模型的迭代,通常分“预训练”和“后训练”两个阶段。
预训练决定了模型的“天赋上限”——也就是基座模型能学进多少知识、多强的逻辑;
而后训练(包括SFT监督微调、RLHF人类反馈强化学习等)则决定了它的“表现下限”——也就是模型多听话、多懂人情世故。
DeepSeek V4.0在今年4月底发布,这俩月他们在干嘛?
应该就是在死磕后训练,把代码和推理的对齐做得更深。
更关键的技术底座,在于他们之前发的那篇mHC(流形约束超连接)架构论文。(感兴趣的可以去读读)

现在顶级大模型普遍采用MoE(混合专家)架构,简单说就是把模型分成很多个“专家网络”,每次只激活一小部分来算,从而在控制计算成本的同时做大事。
但万亿参数级别的MoE模型有个致命弱点——训练极其不稳定,梯度容易崩。
mHC就是来解决这个问题的,它强化了残差连接,使得深层网络的梯度能顺畅回传。
V4.1这次代码能力的暴增,很可能就是因为更大的有效参数量在mHC的保驾护航下被成功激活了。
另外,这次V4.1大概率在推理阶段的显存管理上也做了大优化。
大模型推理分两个阶段:读题的“预填充”和写字的“解码”。
当处理像three.js这种长代码输出时,模型需要记住之前生成的所有内容,这就是KV缓存。
随着序列变长,KV缓存会疯狂吃显存,导致速度骤降。
DeepSeek在V4时代就引入了混合注意力机制,交替使用CSA(压缩稀疏注意力)和HCA(层次聚类注意力),大幅压缩了KV缓存的体积。
V4.1能把复杂的前端代码一口气写完且不崩,这种底层架构的优化功不可没。
另外,这次V4.1大概率在推理阶段的显存管理上也做了大优化。
大模型推理分两个阶段:读题的“预填充”和写字的“解码”。
当处理像three.js这种长代码输出时,模型需要记住之前生成的所有内容,这就是KV缓存。
随着序列变长,KV缓存会疯狂吃显存,导致速度骤降。
DeepSeek在V4时代就引入了混合注意力机制,交替使用CSA(压缩稀疏注意力)和HCA(层次聚类注意力),大幅压缩了KV缓存的体积。
V4.1能把复杂的前端代码一口气写完且不崩,这种底层架构的优化功不可没。
产品节奏:熟悉的配方,但没有多模态
如果你关注DeepSeek比较多,对他们这个节奏应该不陌生——先放个Flash版(参数小的蒸馏版)出来让大家玩玩,顺便压测,然后再上正式版。
去年春节发R1、8月发V3.1,这次赶上端午节,V4.1正式版也许快了?
不过有个点可能会让一些人失望:这次灰度,没有看到多模态能力增强的影子。

百度百科上写的是V4.1“新增了图像和音频处理能力,实现了对文本、图像、音频输入的理解与处理,其输出形式为文本”。
但是在本次爆出的灰度测试中,没有看到这些相关内容。
不管是那个让测试者惊呼的three.js,还是那个变好看了的“鸬鹚SVG”,本质还是代码。
这也符合DeepSeek一贯的性格。
他们定价太低了,多模态吃算力吃得厉害,在这个价格体系下硬上多模态,第三方反代的问题只会更麻烦。
多模态原地踏步,开发者狂欢,非程序员保持冷静
对于写代码的人来说,这肯定是大利好。
如果V4.1 Pro的代码能力真能达到社区现在的预期,能对齐甚至超过现在那些闭源头部模型,那AI编程工具的成本和使用门槛又能降一大截。
但对非程序员来说,可能就没那么兴奋了。
干活的人要的是扔张海报进去能看懂调性,甩段录音进去能出大纲,可惜这次都没有。
DeepSeek本身不生成PPT文件,它输出的只能是Markdown格式的结构化大纲,你得自己再拿去排版,这离“帮你干完一整件事”的智能体体验还有距离。
隐忧与期待:偏科问题怎么解?
当然,从灰度到正式发,还有两个事得看看:
-
一是现在这灰度结果太碎了,后面覆盖能不能稳住;
-
二是如果这次只把代码能力拉满,其他能力反而回退了,那正式版怎么平衡这个“偏科”问题。
反正DeepSeek一直都是低调研发、灰度验证、挑个节日发布的路子。
这次V4.1曝光,大概率也不是意外,而是马上要发的预告了。
你怎么看?

浙公网安备 33010602011771号