DeepSeek-V4-Flash-0731:低价能打,为 Agent 的“长跑”而来

近日,DeepSeek 发布了 DeepSeek-V4-Flash-0731。它是 V4-Flash 的正式版本,面向编程、检索和终端操作等需要连续调用工具的 Agent 任务。

Agent 真正难的不是回答一次问题,而是在长流程里记住任务状态,读懂工具返回的信息,再接着完成下一步。0731 的升级重点,正是让 V4-Flash 更适合这样的连续工作。

PART 01 面向 Agent 长任务的正式版

0731 取代了此前的 Flash Preview,成为 V4-Flash 的正式版本。它的主体结构没有推倒重来,升级主要发生在后训练和 Agent 适配阶段,重点是让模型接住工具结果,沿着原目标继续往下做。

能力之外,正式版还附带 DSpark 推测解码模块。它先提出一小段候选 token,再由主模型批量核验:命中便接纳,否则重新生成。DSpark 不负责让模型“变聪明”,解决的是长输出中的等待问题。对反复调用模型的 Agent 来说,生成速度同样影响任务能否顺畅跑完。

调用成本也会影响 Agent 能跑多远。按照官方价格页,V4-Flash 每百万 tokens 输入 1 元、输出 2 元;命中缓存后,输入只要 0.02 元。长任务往往要携带大段历史,经历多次调用和重试。这个价格让团队有空间增加检索轮次,或者同时尝试两个方案。

速度和价格解决了“能不能多跑几轮”的问题。接下来还要看更基础的一层:当代码、文档和终端日志不断累积,模型能不能把这些内容装下,并且真的跑得动?

PART 02 百万上下文,服务的是长任务

V4-Flash 支持百万 token 上下文。可以把上下文想成 Agent 的工作台:代码、文档、搜索结果和终端日志都摊在上面。桌面足够大,Agent 才不用刚读完需求就丢掉报错,也不必每走一步都重新翻找资料。

它的主体是混合专家架构。整个模型拥有大量“专家”,每次处理内容时只调动其中一部分,因此不必让全部参数同时参与计算。注意力层则由 CSA 与 HCA 交替组成:前者从庞大的历史中寻找相关信息,后者维护压缩程度更高的全局记忆。

从下往上看,输入先进入多层 Transformer。每一层大致分成注意力与前馈网络两段:注意力负责从上下文找信息,DeepSeekMoE 决定本轮让哪些专家参与处理。图中多次出现的 Pre-Block Mixing、Post-Block Mixing 和 Residual Mixing 来自 mHC,也就是流形约束超连接。它让信息在进入模块前、离开模块后进行受控混合,减轻深层网络中信息被冲淡的问题。

顶部的 MTP 是多 token 预测。常规模型训练时主要猜下一个 token,MTP 会同时学习更靠后的多个位置,提供更密集的训练信号。到了推理阶段,附加的 DSpark 再负责提出候选 token。mHC、MTP 和 MoE 各管一件事:信息怎么流、接下来怎么预测、计算交给谁。

V4-Flash 共有 284B 参数,单次生成约激活 13B。它依然是一套大型知识系统,只是每一步都把任务交给少数合适的专家。这种“按需出勤”减轻了单次推理负担,也给低成本运行留下了空间。

真正决定百万上下文能否跑起来的,是 CSA 与 HCA。以 CSA 为例,模型先用 Token-Level Compressor 把成组的 KV 条目压成更短的记录。当前问题到来后,一个轻量索引器会快速打分,再由 Top-k Selector 取出最相关的压缩记录。与此同时,滑动窗口把最近发生的几段原文直接送回注意力层。旧资料看重点,新变化看原文,模型不用每次都翻遍整张“工作台”。

HCA 走的是另一条路线:它把更长的一段历史合并成一个条目,压缩率更高,但不再做稀疏筛选,而是读取压缩后的全局信息。V4 将 CSA 与 HCA 交替放进不同层,一部分负责精准找旧线索,一部分负责守住全局轮廓。两者都保留近期滑动窗口,因此 Agent 刚拿到的终端报错不会被长历史淹没。

据估算:在百万 token 场景下,V4-Flash 单 token 推理计算量约为 V3.2 的十分之一,KV Cache 约为后者的 7%。这意味着读大型代码库、整理跨文档证据或连续检索几十轮时,模型不必为“记住更多”付出同等幅度的计算和显存代价。百万上下文提供容量,架构决定这份容量能否真正用起来。

PART 03 让 Agent 少忘事、少掉线

Agent 的麻烦还不止上下文太长。它经常需要在“思考—调用工具—读取结果—调整下一步”之间来回切换。一次终端命令失败后,模型要记得失败原因;搜索结果返回后,还要把新证据接进原来的判断。如果状态断掉,Agent 看似一直在忙,实际只是在反复重建现场。

DeepSeek-V4 针对工具场景保留跨轮任务状态,让模型能接着前一次操作继续处理;普通对话则不必把每轮内部过程全部拖进下一轮。有工具时,调用结果与后续步骤交错衔接;没有工具时,只保留继续回答所需的信息。

0731 还使用专门的消息编码与解析规则,把用户指令、模型回复、工具调用和返回结果分开。Agent 因而能辨认哪段是准备执行的动作,哪段是终端刚返回的事实,不会在下一轮把报错当成新指令。配合后训练,模型学到了一套连续做事的节奏。

0731 正式版最醒目的变化,也集中在这些 Agent 任务上。Terminal Bench 2.1 中,Flash Preview 得分 61.8,V4-Pro Preview 为 72.1,0731 提高到 82.7;DeepSWE 从 Flash Preview 的 7.3跳到 54.4,V4-Pro Preview 只有 12.8;Toolathlon-Verified 则从 49.7提升到 70.3,也超过了 Pro Preview 的 55.9。

换成增幅看更直观:Terminal Bench 提高了 20.9 个百分点,DeepSWE 约为原来的 7.5 倍,Toolathlon-Verified 提高了 20.6 个百分点。三项测试分别考察终端任务、代码仓库修复和工具调用,正式版在这三类 Agent 工作中都拉开了与自身 Preview 的差距。

即使把对手换成更大的 V4-Pro Preview,0731 在 Terminal Bench 上仍高出 10.6 个百分点,在 Toolathlon-Verified 上高出 14.4 个百分点;DeepSWE 得分更达到它的四倍以上。Flash 到正式版的变化同时落在效率和能力上,Agent 表现确实往前跨了一大步。

正式版沿用了 Preview 的主体架构,能力进化主要来自后训练和 Agent 适配。长上下文架构保存工作现场,消息规则把每次工具交互放回正确位置,后训练再教模型如何根据结果调整动作。这里的“长跑”既包括记得更多,也包括少走回头路,把更多步骤真正做完。

PART 04 榜单之外,更值得看的是性价比

最后看一组第三方数据。Arena发布了一份 Agent 评测快照:DeepSeek-V4-Flash(High)排在第 21 位,相对基线的净提升为 +2.0%;最近 7 天完成一项任务的中位成本为 0.024 美元,也就是两美分出头。它不是榜首,但把效果和花费放在一起看,位置就很醒目:它进入了这张图的成本—效果前沿。

差距有多大?按同一张图的横轴位置粗略估算,0.024 美元约为 GLM-5.2 的四分之一、Kimi K3 的八分之一,不到图中高配 Claude 模型的四十分之一。

现实任务中, Agent 会反复调用模型,也会走错路,每一次重试都要花钱。价格低到这个程度,团队可以增加搜索轮次,也能同时跑几个候选方案。模型不必在每张榜单上夺冠,能力够用、总成本合适,就有机会进入生产选择。

PART 05

OpenCSG社区:

opencsg.com/models/deep

Hugging Face社区:

huggingface.co/deepseek

PART 06 OpenCSG vs 魔搭:如何选择?

模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现,但OpenCSG/CSGHub 的核心在于,它不只是让模型“跑起来”,而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是“模型怎么部署、怎么调用”的问题,更是“模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营”的问题。

对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。

PART 07 关于OpenCSG

OpenCSG 是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

posted @ 2026-08-30 18:15  OpenCSG  阅读(78)  评论(0)    收藏  举报