DeepSeek V4.1 Flash 发布,百万上下文开始算缓存这笔账
模型每调用一次工具,终端日志、搜索结果、代码修改和报错信息都会继续塞进上下文。任务跑得越久,重新读入历史的计算越多,KV Cache 也越大。100 万 token 能不能装下,反倒只是最先遇到的问题。后面还有显存、SSD、带宽,以及长会话恢复时的等待。
近日,DeepSeek 发布 V4.1 Flash,目标“更强、更快、更普惠”。主要处理三个问题:减少长输入的重复计算,压低历史状态的存储开销,再给 Agent 的思考长度加上一档可调预算。
V4.1 Flash 的参数规模比上一代 Flash 大得多,运行时全局缓存却只有后者的约四分之一。报告中的多项设计都围绕这个对聊天模型来说,长上下文意味着一次可以多放几份文档。到了 Agent 场景,它会变成一笔不断滚大的账。变化展开。对聊天模型来说,长上下文意味着一次可以多放几份文档。到了 Agent 场景,它会变成一笔不断滚大的账。
01 代码和 Agent 成绩
DeepSeek V4.1 Flash 是原生多模态 MoE 模型,语言主干有 40 层 Transformer。它包含 552B 主干参数和 196B Engram 条件记忆参数;处理输入时,每个 token 激活约 8B 参数,生成阶段约激活 16B。上下文长度仍是 100 万 token。


主要 Agent 成绩包括:Terminal-Bench 2.1 为 90.6,DeepSWE v1.1 为 74.2,CyberGym 为 88.1,Automation-Bench 为 54.8。
Terminal-Bench 把模型放进终端。它得先判断当前环境里有什么,再执行命令、处理失败,最后交出能通过验证的结果。DeepSWE 更接近真实的软件工程:问题散落在仓库的多个文件中,一处修改可能引出新的测试失败。CyberGym 面向网络安全任务,Automation-Bench 则把模型放进跨应用操作流程。
单轮写代码只是其中很小的一部分。一个仓库任务跑到第三十轮时,Agent 可能已经看过几十个文件,改过配置,装过依赖,还留下两段失败日志。此时真正难的是别把最初的验收条件忘掉,也别把刚刚排除的错误再查一遍。V4.1 Flash 的高分主要出现在这类连续任务上。
这些成绩显示,V4.1 Flash 的代码能力已经延伸到更复杂的多轮执行。和 V4-Flash 0731 相比,Terminal-Bench 2.1 从 82.7 升到 90.6,DeepSWE v1.1 从 54.4 升到 74.2;NL2Repo-Bench、CyberGym 和 Automation-Bench 也分别提高了 11.2、11.4 和 17.1 分。无论是修改完整仓库、操作终端,还是处理安全任务和跨应用流程,进步都很明显。
横向比较同样出色。Terminal-Bench 2.1 的 90.6 高于表中的 Claude Opus 5、GPT-5.6-Sol、GLM-5.3 和 Kimi K3;DeepSWE v1.1 的 74.2 略高于 Claude Opus 5 的 74.0;CyberGym、Automation-Bench 和 Agents' Last Exam 也拿到了表中最高分。这组结果说明,V4.1 Flash 已经能够承担强度较高的代码与 Agent 任务,而且优势并不限于某一种任务形式。
换用不同的 Agent 框架,分数会有波动,但整体仍处在较高水平。报告中,DeepSWE 得分落在 65.5 到 74.2 之间,Terminal-Bench 2.1 落在 84.1 到 90.6 之间。模型本身提供了扎实的能力底座,系统提示词、工具接口和上下文管理则会决定这些能力最终能发挥到什么程度。
更困难的评测上,差距仍然明显。Terminal-Bench 4.0 中,V4.1 Flash 为 31.2, Opus 5 为 51.8;HLE 分别是 36.8 和 56.3。
02 这次更新为什么一直在谈 KV Cache
过去几代模型已经把长序列的注意力计算压低了不少。计算下降之后,原本没那么显眼的 KV Cache 开始卡住部署。
KV Cache 保存历史 token 的注意力状态。模型生成下一个 token 时,可以直接取用这些状态,不必从头再算。问题是,长会话一多,缓存会迅速占满高带宽显存。为了让 Agent 之后接着干,还要把部分缓存放进主机内存或 SSD;恢复任务时,再把它们搬回来。于是,同一份上下文会同时消耗显存容量、持久化存储和传输带宽。

工具调用会频繁触发预填充。新的观察结果经常会连同旧历史一起送入模型;如果前缀缓存没有命中,整段输入就得重新处理。上下文已经累积到几十万 token 时,这一步很贵。
DeepSeek 为此设计了 Causal Encoder-Decoder,简称 CED。40 层网络从中间切开,前 20 层是因果编码器,后 20 层是解码器。长输入先经过编码器;解码器需要的全局 KV,不再由每一层拿着完整输入重新生成,而是从编码器最后一层的隐藏状态投影出来。
局部信息的处理没有省掉。每一层仍有滑动窗口注意力,照看离当前 token 最近的内容。恢复解码器局部状态时,系统只重放最近 128 个 token,而不是让整段历史再走一遍后 20 层。输入远长于窗口时,CED 可以把预填充计算降到原来的近一半。
压缩后的全局分支负责较远的历史,滑动窗口保留近期内容的完整状态。刚返回的报错和上一条工具结果通常需要逐字处理,几百轮之前的信息只在相关时被调回。
V4.1 Flash 还把原来的 mHC 改成 Single-Pass mHC。mHC 负责深层网络里的信息混合,旧实现要经过四个内核;新版把过程合并,相应的 Mega-mHC 内核将激活内存流量减半。它解决的是内存读写次数,而非注意力计算本身。
03 CSA2 怎么把每个 token 压到 890 字节
CSA2 负责减少缓存。V4.1 Flash 放弃了上一代 CSA 与 HCA 混合的全局注意力结构。除编码器最前面的两层只使用滑动窗口外,其余层的全局分支统一改用 CSA2。
CSA2 有 Full、Reindex 和 Reuse 三种模式。Full 层负责生成全局 KV、索引键和 Top-K 位置;Reindex 层沿用前面 Full 层的 KV,但根据本层查询重新排一次相关位置;Reuse 层更省,KV 和 Top-K 结果都直接复用。三种模式仍会计算各自的查询,并保留本层的滑动窗口 KV。

FULL
完整缓存与索引
负责生成全局 KV、索引键和 Top-K 位置
REINDEX
重排相关位置
沿用前面 Full 层的 KV,根据本层查询重新排序
REUSE
直接复用结果
KV 和 Top-K 结果都直接复用,尽可能减少重复工作
Full 层承担完整的缓存和索引计算,Reindex 层保留本层重新选择相关位置的机会,Reuse 层则尽可能减少重复工作。这样既不用给每层各存一套全局 KV,也没有强迫所有层使用完全相同的检索结果。
解码器里还有一层粗筛。第一个索引器先从完整历史中找出最多 16384 个候选位置,后续索引器只在这个候选池里打分,最后取 Top-512 送入注意力。这样既缩小搜索范围,又允许后面的层根据自己的问题改变选择。
缓存精度也降了。全局 KV 使用 FP4,局部滑动窗口仍为 FP8。跨层复用、稀疏检索和低精度存储叠在一起后,V4.1 Flash 的全局 KV Cache 为 890 字节/token。上一代 V4 Flash 是 3514 字节,前者大约只有后者的四分之一;如果和 2023 年的 DeepSeek V1 相比,已经缩小约 437 倍。

运行时缓存主要待在 HBM,跨请求保存的持久化缓存则更多落在 SSD 或主机内存。SWA Bounded Replay 不再把每一层的滑动窗口 KV 全部写进 SSD,而是在会话恢复时,用最近一个窗口近似重建。根据报告,这带来的性能损失很小,持久化 KV Cache 则降至 V4 Flash 的约八分之一。
同样的显存因此可以容纳更多长会话,缓存落盘和恢复时需要传输的数据也更少。Agent 进行几十次工具调用后,历史还在继续增长,但缓存成本不会再按原来的幅度上涨。
04 Engram 和 DSpark 各管一件事
V4.1 Flash 有 196B Engram 参数。
MoE 负责从大量专家中选出少数参与当前计算,Engram 更像一块可查询的条件记忆。它使用二元、三元和四元 n-gram,再通过八组哈希头定位记忆条目。相关内容可以从主机侧提前取回,不需要让全部 Engram 参数随每个 token 一起激活。
某些常见搭配、实体关联和局部知识可以直接查找;需要结合上下文判断的部分,再交给神经网络计算。这样增加模型容量,算力不必跟着总参数一比一增长。查找本身仍会占用带宽,因此 Engram 表采用分片存储,并通过 RDMA 提前取回可能用到的条目。
DSpark 处理的是另一段等待:逐 token 解码。它并行起草多个后续位置,再交给主模型验证。候选足够可靠就一次接纳多个 token,不可靠则回到常规生成。置信度调度器会根据候选质量决定验证时机。
DSpark 不改变主模型的答案能力,只缩短生成等待。
05 Agent 后训练要先解决沙箱
V4.1 Flash 使用 45T token 的多模态语料进行预训练,文本与多模态数据约为 7:1。视觉信息从语言模型预训练阶段就进入同一条序列。
视觉编码器 DeepSeek-ViT 支持可变分辨率。图片经过 3×3 pixel-unshuffle 后,视觉 token 数量减少九倍,支持的输入分辨率可到约 1344×1344。模型可以读取网页、图表、软件界面和执行后的截图。完成操作后再检查环境的新状态,它才有机会发现按钮点错了,或者生成的页面已经溢出。
后训练依次经过 SFT、异步强化学习和 OPD。算法名称并不新鲜,真正花力气的是训练环境。DeepSeek 为此建设了 DSec 沙箱系统,让代码、终端和工具任务可以大规模执行和验证。系统采用定制调度器,目标规模达到数百万容器;在相近负载下,单个物理节点的并发容器数量从约 1000 个提高到 2500 个以上。
这类环境决定了 Agent 能学到什么。如果训练数据只有问题和标准答案,模型很难学会命令失败之后怎么改。沙箱会返回真实日志、测试结果和系统状态,模型的整条操作轨迹都能被判断。报告还提到,有些训练中的 Agent 会删掉关键二进制文件、破坏文件系统,甚至尝试利用环境漏洞。DSec 用 AppArmor 和基于 eBPF 的网络策略做隔离,环境被破坏则把本轮轨迹记为失败。Agent 后训练因此需要建设和维护大量可执行环境。
06 思考越久不一定越划算
V4.1 Flash 把 reasoning effort 作为强化学习的显式条件,取值范围为 1 到 100。API 目前分成 low、high 和 max 三档,分别对应 50、75 和 100。

从 effort 25 提高到 100,八项推理测试的平均 Pass@1 从 67.1% 上升到 76.3%;DeepSWE 从 66.0% 升至 74.2%;Terminal-Bench 2.1 从 82.4% 升至 90.6%。平均输出 token 同时增加到约 2.5 倍。
曲线前半段涨得快,后半段逐渐变平。effort 60 到 80 已拿到大部分准确率收益;从 80 继续拉到 100,Agent 轨迹会增长约 1.6 至 1.8 倍,分数只再上升一点。日常代码修改把预算开到 max,往往只是让模型想得更久。跨文件调试、复杂安全任务或者需要多次验证的工作,才更值得付这笔 token 成本。
调用方可以根据任务难度调整预算。同一个 Agent 流程也不必从头到尾使用一档设置:先用中档定位问题,遇到测试反复失败,再把关键步骤升到高档。
07 100 万上下文的边界
部署门槛仍然很高。V4.1 Flash 每个 token 会激活数十亿参数,权重体量达到数百 GB。即使采用混合精度,普通工作站也很难完整承载;如果还要跑到 100 万 token,上下文缓存和服务冗余也要占掉额外资源。
V4.1 Flash 能接收 100 万 token,不表示放在窗口里的每个细节都能稳定找回。基础模型在 LongBench V2 上得到 45.2,只比 V4 Flash 的 44.7 略高,低于 V4 Pro 的 51.5。CSA2 可能选错相关位置,SWA Bounded Replay 的近似重建也可能在极端输入下损失信息。
DeepSeek 同时下调了 V4.1 Flash 的 API 价格。每百万 token 的空闲时段价格为:缓存命中输入 0.02 元,未命中输入 1 元,输出 4 元;高峰时段分别为 0.04 元、2 元和 8 元。
Agent 一项任务可能调用几十轮,还会携带越来越长的历史。此时总费用取决于缓存命中、输出长度和失败重试次数,不能只看一次请求的单价。
预填充少算近一半,全局 KV Cache 降到 890 字节/token,持久化缓存也只有上一代的约八分之一。长任务因此可以少占一些显存和存储,会话恢复时需要搬运的数据也更少。不过,缓存压缩解决不了所有问题。V4.1 Flash 在高难任务上仍有差距,100 万 token 的窗口里也可能漏掉线索。它到底能省下多少成本,最后还要看完成一项真实任务需要调用多少轮、生成多少 token,又会失败重试几次。
08 模型下载
OpenCSG社区:
https://opencsg.com/models/deepseek-ai/DeepSeek-V4.1-Flash
Hugging Face社区:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
09 OpenCSG vs 魔搭:如何选择?
模型部署在魔搭、OpenCSG 等模型社区中均可实现,但 OpenCSG/CSGHub 的核心在于,它不只是让模型"跑起来",而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是"模型怎么部署、怎么调用"的问题,更是"模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营"的问题。
对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。
关于 OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps 是人工智能领域的一种 AI 原生方法论,由 OpenCSG(开放传神)提出。AgenticOps是 Agentic AI 的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。

浙公网安备 33010602011771号