DeepSeek V4.1灰度测试泄露,据说代码能力“天差地别”?但多模态能力还是原地踏步

大家好,我是小九。

昨天刷社区的时候,发现DeepSeek V4.1 Flash灰度测试了。

DeepSeek V4.1 Flash灰度泄漏:代码能力“天差地别”

6月15号,Linux.do上有个老哥发帖,说DeepSeek网页端好像偷偷上新模型了。

他先试了那个“鸬鹚SVG”测试,生成的图比之前好多了。

他还测了一下经典的金门大桥three.js场景,用他的原话说,跟之前比是“天差地别”。

他还发现了另一个很明显的变化,模型的知识截止日期从2025年5月跳到了2026年1月,还有人测出来到了5月的。

不过这也挺薛定谔的,有人看到1月,有人看到的居然还停在2024年,甚至同一个用户隔一会儿问,给出的答案都不一样。

大家都在猜,这大概率就是V4.1的Flash版开始灰度了。

技术底座:不是微调,是代际跨越

我觉得,能让人说出“天差地别”这四个字,肯定不是修修补补的微调,大概率是基模型本身有了真正的代际跨越。

想要理解这种跨越,咱们得稍微往深了看一眼。大模型的迭代,通常分“预训练”和“后训练”两个阶段。

预训练决定了模型的“天赋上限”——也就是基座模型能学进多少知识、多强的逻辑;

而后训练(包括SFT监督微调、RLHF人类反馈强化学习等)则决定了它的“表现下限”——也就是模型多听话、多懂人情世故。

DeepSeek V4.0在今年4月底发布,这俩月他们在干嘛?

应该就是在死磕后训练,把代码和推理的对齐做得更深。

更关键的技术底座,在于他们之前发的那篇mHC(流形约束超连接)架构论文。(感兴趣的可以去读读)

现在顶级大模型普遍采用MoE(混合专家)架构,简单说就是把模型分成很多个“专家网络”,每次只激活一小部分来算,从而在控制计算成本的同时做大事。

但万亿参数级别的MoE模型有个致命弱点——训练极其不稳定,梯度容易崩。

mHC就是来解决这个问题的,它强化了残差连接,使得深层网络的梯度能顺畅回传。

V4.1这次代码能力的暴增,很可能就是因为更大的有效参数量在mHC的保驾护航下被成功激活了。

另外,这次V4.1大概率在推理阶段的显存管理上也做了大优化。

大模型推理分两个阶段:读题的“预填充”和写字的“解码”。

当处理像three.js这种长代码输出时,模型需要记住之前生成的所有内容,这就是KV缓存。

随着序列变长,KV缓存会疯狂吃显存,导致速度骤降。

DeepSeek在V4时代就引入了混合注意力机制,交替使用CSA(压缩稀疏注意力)和HCA(层次聚类注意力),大幅压缩了KV缓存的体积。

V4.1能把复杂的前端代码一口气写完且不崩,这种底层架构的优化功不可没。

另外,这次V4.1大概率在推理阶段的显存管理上也做了大优化

大模型推理分两个阶段:读题的“预填充”和写字的“解码”。

当处理像three.js这种长代码输出时,模型需要记住之前生成的所有内容,这就是KV缓存

随着序列变长,KV缓存会疯狂吃显存,导致速度骤降。

DeepSeek在V4时代就引入了混合注意力机制,交替使用CSA(压缩稀疏注意力)和HCA(层次聚类注意力),大幅压缩了KV缓存的体积

V4.1能把复杂的前端代码一口气写完且不崩,这种底层架构的优化功不可没。

产品节奏:熟悉的配方,但没有多模态

如果你关注DeepSeek比较多,对他们这个节奏应该不陌生——先放个Flash版(参数小的蒸馏版)出来让大家玩玩,顺便压测,然后再上正式版。

去年春节发R1、8月发V3.1,这次赶上端午节,V4.1正式版也许快了?

不过有个点可能会让一些人失望:这次灰度,没有看到多模态能力增强的影子。

百度百科上写的是V4.1“新增了图像和音频处理能力,实现了对文本、图像、音频输入的理解与处理,其输出形式为文本”。

但是在本次爆出的灰度测试中,没有看到这些相关内容。

不管是那个让测试者惊呼的three.js,还是那个变好看了的“鸬鹚SVG”,本质还是代码。

这也符合DeepSeek一贯的性格。

他们定价太低了,多模态吃算力吃得厉害,在这个价格体系下硬上多模态,第三方反代的问题只会更麻烦。

多模态原地踏步,开发者狂欢,非程序员保持冷静

对于写代码的人来说,这肯定是大利好。

如果V4.1 Pro的代码能力真能达到社区现在的预期,能对齐甚至超过现在那些闭源头部模型,那AI编程工具的成本和使用门槛又能降一大截。

但对非程序员来说,可能就没那么兴奋了。

干活的人要的是扔张海报进去能看懂调性,甩段录音进去能出大纲,可惜这次都没有。

DeepSeek本身不生成PPT文件,它输出的只能是Markdown格式的结构化大纲,你得自己再拿去排版,这离“帮你干完一整件事”的智能体体验还有距离。

隐忧与期待:偏科问题怎么解?

当然,从灰度到正式发,还有两个事得看看:

  • 一是现在这灰度结果太碎了,后面覆盖能不能稳住;

  • 二是如果这次只把代码能力拉满,其他能力反而回退了,那正式版怎么平衡这个“偏科”问题。

反正DeepSeek一直都是低调研发、灰度验证、挑个节日发布的路子。

这次V4.1曝光,大概率也不是意外,而是马上要发的预告了。

你怎么看?

posted @ 2026-06-16 14:58  九章智算云  阅读(585)  评论(0)    收藏  举报