LLM · 技术报告速读 | DeepSeek 系列
技术报告列表
- v3:https://arxiv.org/abs/2412.19437
- r1:https://arxiv.org/abs/2501.12948
- v3.2:https://arxiv.org/abs/2512.02556 (html:https://arxiv.org/html/2512.02556v1 )
- v4:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
(目前只读了 v3.2 和最新的 v4,其实是因为,感觉 r1 和 v3 太有名了,所以就反直觉的没有读它们)
- DeepSeek-Coder-V2,2024 年 6 月,https://arxiv.org/abs/2406.11931
- (以下为 ai 省流,不保证正确性;我还没读)
- 经典的 MoE 代码模型,支持 338 种语言和 128K 上下文,其数据配比(60%代码/10%数学/30%自然语言)对构建 Agent 基座极具参考价值。
- 2024 年 1 月发布。需要说明的是,DeepSeek 目前尚未发布独立的 Coding Agent 系统级技术报告,该报告是其代码基础模型论文,社区通常基于 DeepSeek-V3 / R1 / Coder 等基座模型自行构建 Coding Agent。论文介绍了代码预训练、指令微调与仓库级代码理解能力,是构建 Coding Agent 的重要底座参考。
- DualPath 推理框架论文(DeepSeek,2026-05-07)
- (以下为 ai 省流,不保证正确性;我还没读)
- 专为 DeepSeek-V4 设计的并行推理框架,通过优化长序列处理和多步推理的调度策略,有效提升了 Agent 在复杂编码与思考场景下的响应速度与吞吐量。
- 这个完全还没看。
个人收获总结
v3.2 我主要在看 1. GRPO 的稳定技术(keep routing 之类的),2. 如何自动合成 agent 任务的数据,3. 如何管理 thinking 和 tool use 的 context(并且联想到了 mirothinker 的扔掉 observation、只保留 think)。
不懂 infra,所以 v4 我主要在看 1. OPD,2. v4 也用了 Muon,3. 管理 thinking 和 tool use 的 context 跟 v3.2 的区别。
DeepSeek v3.2
主要内容:
- 三大技术突破:DeepSeek Sparse Attention (DSA)、可扩展的强化学习框架、大规模 agent 任务合成。
- 各种 attention 那些我不太懂,没有重点读,其他两部分都重点读了。
技术报告的结构:
- abstract 在划重点。1 intro 感觉算是一个总结。sec 2 是 architecture。sec 3 是后训练,3.1 是 RL 那些,3.2 是 agent 如何造数据相关的。sec 4 是 evaluation,各个 benchmark 上的性能,以及一些 ablation。sec 5 是 conclusion 和未来展望。
参考资料:
1 DeepSeek v3.2 架构方面的创新
- 似乎用的不是 原生稀疏注意力(Native Sparse Attention, NSA) 而是 DSA(DeepSeek Sparse Attention)。
- 这一块还没详细看,如果有需要,后面会来补的。
2 DeepSeek v3.2 的后训练(sec 3.1)
Section 3.1 的核心目标是解决一个关键工程难题:当强化学习(RL)的计算预算大幅扩展(后训练算力已超过预训练成本的 10%)时,如何保证 GRPO 算法在混合任务、长轨迹生成、MoE 架构下的稳定性与可扩展性。
原文并未引入全新的 RL 算法,而是针对大规模 RL 训练中必然出现的四个致命痛点,提出了四项底层稳定化技术。
DeepSeek v3.2 如何做后训练:
- Continued Pre-Training(sec 2.1.1):从 DeepSeek-V3.1-Terminus 的基础检查点开始,其上下文长度已扩展至 128K,我们进行了持续预训练,然后进行后训练,以创建 DeepSeek-V3.2。
- 后训练:专家蒸馏(specialist distillation);专家模型训练完成后,用于生成领域特定的蒸馏数据,供主模型学习;混合强化学习训练(mixed RL training)。
- reward:推理和智能体任务,使用三种可量化的奖励组合:基于规则的结果奖励(答案对不对)+ 长度惩罚(防止思考过长,控制效率)+ 语言一致性奖励(确保生成内容在语言上不自相矛盾)通用对齐任务:使用生成式奖励模型。这个模型会针对每个问题动态生成一套评估标准,然后根据这套标准打分。
首先,我们回顾 GRPO 的 objective:
- 重要性采样比:\(r_{i,t}(\theta) = \frac{\pi_\theta(o_{i,t}|q, o_{i,<t})}{\pi_{\text{old}}(o_{i,t}|q, o_{i,<t})}\)
- 优势函数:\(\hat{A}_{i,t} = R_i - \text{mean}(R)\),组内奖励归一化后直接作为优势值,无需独立 Value Network。
- 痛点:当 rollout 数据量大、更新步数多、MoE 路由动态变化时,\(\pi_{\text{old}}\) 与 \(\pi_\theta\) 的分布偏移会迅速放大,导致 KL 估计有偏、梯度噪声累积、训练崩溃。
1 无偏 KL 估计 (Unbiased KL Estimate)
标准 RL 中常用的 K3 KL 估计器(请参见:LLM 算法岗 | 八股问答(3)· 强化学习与 RLHF):
(看来大家还是用 k3 的)
在 \(\pi_\theta \ll \pi_{\text{ref}}\)(当前策略概率远低于参考策略)时,上述的 k3 估计器会产生无界的大权重。这些异常权重会转化为高噪声梯度,在多次更新后累积,导致后续采样质量下降、训练动态失稳。
解决方案:通过重要性采样比修正 KL 梯度的计算方式,使其在数学上严格无偏。修正后的 KL 项为:
核心收益:
- 消除系统性偏差:梯度不再因低概率 token 产生爆炸性更新,训练收敛轨迹平滑。
- 支持领域自适应正则化:不同任务对 KL 惩罚的敏感度不同。例如数学证明任务可大幅弱化甚至完全关闭 KL 正则(\(\beta \approx 0\)),而通用对话任务保持标准强度,实现“一算法多配置”的灵活调度。
2 Off-Policy 序列掩码 (Off-Policy Sequence Masking)
为了提高训练效率,生成一批数据后会被分成多份反复训练(多轮更新),这会产生“off-policy”问题,即当前要更新的策略,和当初生成数据时的旧策略已经不一样了。
模型从自身错误中学习收益最大,但严重 off-policy(训练时概率极低,因为其生成时的旧策略与当前策略差异过大)的负样本(负 advantage 序列)具有强误导性。我们引入一个掩码机制,切断其梯度回流。
解决方案:我们主动屏蔽掉“过时”的错误数据,只让模型从那些与当前策略差距不大的错误中学习,确保模型“从自己的错误中学习”,而不是从“一个已经不太像自己的旧版本的错误”中学习。
在 GRPO 损失中引入二元掩码 \(M_{i,t}\),仅对负优势且策略偏移过大的序列进行屏蔽:
- \(\delta\):控制策略发散阈值的超参数。
- \(\pi_{\text{old}}\):直接取自推理框架返回的采样概率,同时涵盖“多次更新偏移”与“框架实现差异”。
这样,我们允许在同一个 rollout batch 上进行更多安全梯度步,显著降低大规模 RL 的显存与通信开销。
3 保持专家路由 (Keep Routing) [MoE 专属]
MoE 模型仅在推理时激活部分专家。但由于:
- 推理框架与训练框架的路由实现细节不同;
- 策略更新导致同一输入的路由概率分布漂移;
会导致同一 prompt 在 rollout 和 training 阶段激活不同的专家子集。这种参数子空间的突变会破坏优化轨迹,加剧 off-policy 问题。
解决方案:在 rollout 采样阶段,记录并缓存每个 token 实际激活的专家路由路径。在后续训练更新时,强制模型复用该路由掩码,确保被优化的参数子空间与生成数据时完全一致。
该机制自 DeepSeek-V3-0324 起已成为 MoE 模型 RL 训练的强制组件,是保障 MoE 策略梯度稳定性的基石。
4 保持采样掩码 (Keep Sampling Mask)
RL 中广泛使用 Top-p / Top-k 采样以提升输出质量。但截断操作会改变动作空间:\(\pi_{\text{old}}\) 采样时屏蔽了低概率 token,而 \(\pi_\theta\) 训练时默认全词表计算概率。这直接违反重要性采样的基本假设(动作空间必须一致),导致梯度方差爆炸、语言连贯性下降。
解决方案:在 \(\pi_{\text{old}}\) 采样阶段,保留 Top-p/k 的截断掩码。在 \(\pi_\theta\) 训练计算时,将该掩码严格同步应用,强制两者在完全相同的词表子集上进行概率归一化与梯度更新。
核心收益(这个是 ai 总结的,我没有特别看懂):
- 重建重要性采样假设:动作空间对齐后,\(r_{i,t}(\theta)\) 的估计恢复无偏性。
- 保留语言流畅度:Top-p 采样 + 掩码同步的组合,在提升样本质量的同时,有效防止 RL 训练中常见的“复读机”或“逻辑断裂”现象。
3 DeepSeek v3.2 的 agent 相关技术
这部分解决了一个核心问题:如何让模型在调用外部工具(如搜索引擎、代码解释器)的复杂交互中,依然保持深度、连贯的推理能力。
1 思考上下文管理
问题:DeepSeek-R1 等早期推理模型有一个习惯:一旦对话进入下一轮,就会丢弃之前的推理内容。这在纯文本问答中尚可,但在“思考-行动-观察”循环的工具调用场景中,会导致模型每次收到工具返回结果后都要重新推理一遍整个问题,既浪费 Token,又容易丢失思路。
DeepSeek-V3.2 的机制:
- 保留思考:当新消息是工具返回的结果时,历史推理内容全部保留。模型可以在一个连续的思维上下文中,反复调用工具、观察结果、调整策略。
- 清空思考:只有当出现新的用户消息时,才会清空历史的推理内容,开始一轮全新的思考。
这样,模型在单次用户请求下的整个工具调用链中,推理是层层递进、不断累积的,大大提升了效率和连贯性。
兼容性提示:论文特别指出,某些 Agent 框架(如 Roo Code、Terminus)会通过模拟用户消息来触发工具交互。这恰好会触发“清空思考”的规则。因此,在这些框架下,建议使用非思考模式,以发挥最佳性能。
(这个跟 mirothinker 那个保留最近 5 轮的 (s, thinking, a),剩下更早的 turn 只保留 (thinking, a),感觉有点像)
2 冷启动
在训 RL 的早期 prompt 里面加格式。
具体的,在 RL 训练的数据采样阶段,通过设计特殊的 system prompt,让模型在已有能力基础上"偶然"生成思考+工具调用的混合轨迹,这些轨迹作为 RL 的 bootstrap 数据
- 纯推理数据:system prompt 明确要求模型先推理后回答,用
<think> </think>标签包裹推理过程。 - 非推理的 Agent 数据:系统提示中包含工具调用的格式指引。
- 混合数据:设计一种新的系统提示,明确指示模型在推理过程中嵌入工具调用。
感觉这很像上一个版本大家经常说的,先用一部分 SFT 数据让模型学会基本的指令遵循(如学会调 tool),然后就可以训 RL 了。
3 用于智能体推理的全新合成任务流水线
有了冷启动数据,接下来就是通过强化学习让模型精通“思考 + 工具”这种技能。这需要一个规模巨大、种类繁多的训练任务池。
每类任务的合成 / 构建方式:
搜索 Agent:
- 目标:让模型学会使用搜索工具回答复杂、长尾的信息查询。
- 合成流水线:
- 实体采样:从大规模网页语料中,筛选出分布在不同领域、信息量丰富的“长尾实体”(如冷门的历史事件、特定产品型号等),作为查询的锚点。
- 问题生成:一个专门的“出题Agent”以该实体为出发点,使用搜索工具进行多轮探索(可配置搜索的深度和广度),将获取的信息整合成问题-答案对。
- 多答案生成:用多个配置不同的Agent(不同模型检查点、不同系统提示)为同一道题生成多样化的候选答案。
- 验证与筛选:一个拥有搜索能力的“验证Agent”对所有答案进行多轮核实。只保留满足两个条件的样本:(a) 标准答案正确;(b) 所有候选答案中至少有一个是错误的。这就确保了题目既可靠又具有挑战性(因为连部分模型都能做错)。
- 数据增强:为了更贴近真实用户需求,还会从现成的Helpful RL数据集中筛选出那些使用搜索工具有明显帮助的实例,加入训练池。
- 奖励机制:对于可验证事实,用规则化奖励;对于实用性、帮助性等主观维度,使用一个生成式奖励模型根据评估量规打分。两者结合,兼顾了事实准确和回答有用。
代码 Agent:
- 目标:让模型学会在真实代码仓库中定位Bug并生成修复补丁。
- 合成流水线:
- 数据挖掘:从GitHub上挖掘数百万个“Issue - Pull Request”对。用启发式规则和LLM进行严格过滤,确保每个条目都有:合理的Issue描述、一个正确的修复补丁(Gold Patch)、以及一个用于验证的测试补丁。
- 环境构建:这是关键难点。一个基于DeepSeek-V3.2的“环境搭建Agent”会自动为每个Issue-PR对构建可执行的修复环境。它负责安装依赖包、处理环境冲突、执行测试。
- 验证标准:构建成功的标准是:应用正确的修复补丁后,有测试用例从失败变通过(F2P > 0),并且没有新的测试失败(P2F = 0)。
- 成果:通过这套流水线,最终构建了数万个可复现的代码修复环境,覆盖Python、Java、JavaScript、TypeScript、C、C++、Go、PHP等多种编程语言。
代码解释器 Agent:
- 任务描述:用户的问题是自然语言,但是要写点代码验证才能回答。
- 目标:让模型学会使用 Jupyter Notebook 作为代码执行工具来解决复杂推理题。使用隔离 Jupyter Notebook(120 秒超时限制)。
- 构建方式:精选了一批覆盖数学、逻辑、数据科学等领域的难题,这些题必须通过编写和执行代码才能得到答案。模型需要自己决定何时写代码、写什么代码、以及如何解读执行结果。
通用 Agent:
- 目标:通过合成方式,创造出数量庞大、种类繁多、难解决但易验证的任务,以训练模型的通用工具使用和泛化能力。
- 合成流水线(这是一个自我进化的闭环)
- 环境与数据初始化:给定一个任务类别(如旅行规划),合成 Agent 在一个配备 bash 和搜索工具的沙盒中,用工具从互联网获取或生成相关数据,存入沙盒数据库。
- 工具集构造:Agent 合成一套针对该任务的专用工具函数(如 get_all_hotels_by_city),每个函数就是一个可调用的 API。这界定了模型可用的“动作空间”。
- 任务生成与难度升级:
- 先生成一个简单任务,同时写出其解决方案函数和验证函数。
- 关键约束:解决方案函数只能调用工具函数或进行逻辑计算,不能直接访问数据库或调用其他函数。这强制任务必须通过工具接口来完成,和真实 Agent 的调用模式一致。
- 运行验证函数检查方案输出。不通过就修改。
- 验证通过后,Agent 迭代增加任务难度,并同步更新方案和验证逻辑。
- 如果现有工具不足以解决升级后的任务,Agent 会自动扩充工具集。
- 最终筛选:在合成数据集上对 DeepSeek-V3.2 进行 RL 训练,只保留 pass@100 > 0 的任务。最终得到 1,827 个环境和 4,417 个任务。
论文中的旅行规划案例是绝佳示例:找到符合所有复杂约束的三日行程是困难的(搜索空间巨大),但验证一个给定行程是否满足约束却很简单(逐条检查即可)。这种“难解决、易验证”的特性,为 RL 提供了完美的、无需人工标注的奖励信号。
DeepSeek v4
技术报告的结构:1. intro,2. architecture,3. General Infrastructures 似乎是一些训练过程的 infra 优化;4. pre-training 预训练(4.3 evaluations),5. post-training 后训练(5.3 benchmark evaluation,5.4 real-world task 上的 performance);6. conclusion。
infra 这些我都不懂,只简单看了后训练部分 和少量预训练部分。
1 DeepSeek v4 的 infra 省流
以下都是 ai 省流。如果有需要,会回来补的。
sec 2 的 architecture 部分:
- v3 的某一个版本就是 moe 了,v4 也是 moe。
- (这个也是从 v3 的某一个版本来的)多 Token 预测 (MTP):不只预测下一个词,而是同时预测下几个词,能增强模型的整体能力。
- 架构创新:加强版残差连接 mHC,混合注意力机制 - 压缩稀疏注意力 (CSA) 重度压缩注意力 (HCA)。
- 对 MoE 的小调整:1 将计算路由得分的激活函数从 Sigmoid 换成了 Sqrt(Softplus(·))。2 模型最开始的几层,改用了一种基于固定规则的哈希路由,替代了原来的密集层。
sec 3 的 infra 部分:
- MoE 通信 - 计算重叠(细粒度 Expert Parallelism);
- (好像是手写 cuda 算子之类的)很多计算,如矩阵乘法,直接停用传统 cuBLAS 库,全面换用自己的 DeepGEMM,因为它能保证“批次不变性”,即一个 Token 的结果和它在一个 Batch 里的位置无关,这是推理和训练一致性的基础。TileLang:Kernel 开发 DSL。
- 针对 Muon 优化器、mHC 和新注意力机制,解决了内存、复现和长上下文训练的挑战。
- Muon 优化器:传统 ZeRO 优化是为 Adam 设计的,不适用于需要完整矩阵运算的 Muon。他们设计了一种混合背包算法,把参数矩阵打散、分组、打包,塞进不同的并行策略里,让 Muon 也能用上 ZeRO 来节省内存。
- 新型连接(mHC):为激活值和通信带来巨大开销。通过选择性重计算(只重算相对便宜的,不重算费劲的)和定制融合内核,将额外时间开销压到了仅 6.7%。
- 长上下文注意力:百万 Token 的序列训练,采用了巧妙的两阶段通信:先让 GPU 间交换末尾的数据,统一压缩后再全局收集。完美解决了压缩块可能跨 GPU 边界的难题。
- 为百万级 Token 的推理服务,设计了“异构 KV 缓存管理器”。
2 DeepSeek v4 的预训练
01 数据构成与质量策略:预训练语料总量 >32T tokens,在 DeepSeek-V3 基础上进行了系统性增强。
02 优化器:Muon + AdamW 混合。Embedding / Prediction Head / RMSNorm:AdamW;其余所有模块(含 MoE、Attention、mHC):Muon。
🔍 为什么用 Muon?Muon 通过 hybrid Newton-Schulz 迭代对梯度矩阵做近似正交化,能显著提升训练稳定性与收敛速度,尤其适合超大规模稀疏模型。
03 序列长度 / 注意力稀疏性:渐进训练:采用 "Dense → Sparse" 两阶段训练,避免模型早期因稀疏注意力而学习困难:
| 阶段 | 序列长度 | 注意力类型 | 说明 |
|---|---|---|---|
| Phase 1 | 4K → 16K → 64K | Dense Attention | 前 1T tokens 用标准注意力打基础 |
| Phase 2 | 64K → 1M | Sparse Attention (CSA/HCA) | 引入稀疏性;先用短阶段 warmup lightning indexer,再全量训练 |
这种"先稠密后稀疏"的课程学习(curriculum learning)策略,是超长上下文模型训练的关键技巧。
04 训练稳定性技巧
训练万亿参数 MoE 模型极易出现 loss spike,DeepSeek-V4 提出两项原创性稳定技巧:
1 Anticipatory Routing(预取路由)
- 问题根源:MoE 路由网络与主干网络同步更新时,路由决策的微小波动会被放大,引发梯度异常 → loss spike。
- 解决方案:似乎是 routing 网络和主干网络进行一个异步的更新。Step t-Δt: 预计算并缓存路由索引;Step t: 用缓存索引 + 当前主干参数计算。
- (这个其实没太看懂)
2 SwiGLU Clamping(激活值截断)
- 问题根源:MoE 中 expert 输出可能出现极端值(outliers),经 SwiGLU 非线性放大后导致梯度爆炸。
- 解决方案:进行一些截断。
# qwen 给的伪代码
linear_part = clamp(x·W_linear, min=-10, max=10)
gate_part = clamp(x·W_gate, max=10) # 仅上限
output = gate_part ⊙ Swish(linear_part)
05 evaluation
| 维度 | 代表 Benchmark |
|---|---|
| 世界知识 | MMLU-Pro, SimpleQA-Verified, C-Eval, TriviaQA, SuperGPQA |
| 语言理解 & 推理 | BBH, DROP, HellaSwag, WinoGrande |
| 代码 & 数学 | HumanEval, GSM8K, MATH, BigCodeBench, CMath |
| 长上下文 | LongBench-V2 |
3 DeepSeek v4 的后训练
把 v3.2 的 RL 换成了 on-policy distillation(OPD):
1 独立培养领域专家:
- 首先,针对数学、编程、智能体、指令遵循等特定领域,从基础模型分别独立训练出多个顶尖的“专家”模型。
- 每个专家模型都经过了高质量的 SFT + RL(GRPO)优化。
- 好像在 生成式奖励模型(Generative Reward Model, GRM)还有一些创新,似乎是直接用 actor 网络作为 GRM,自己写完答案 自己 evaluate(?)
- 为了让一个模型能适应不同复杂度、不同响应时间要求的任务,DeepSeek-V4 为同一个专家模型训练了三种不同的推理模式。这并非训练三个独立模型,而是通过在 RL 阶段施加不同约束来实现的。
| 模式 | 特点 | 典型场景 | 响应格式 |
|---|---|---|---|
| Non-Think | 快速直觉响应,基于习惯或简单规则 | 日常任务、低风险决策 | 直接输出 </think> + 答案 |
| Think | 有意识逻辑分析,较慢但更准确 | 复杂问题求解、中等风险决策 | <think> 推理过程 </think> 答案 |
| Think Max | 推理能力推到极限,慢但强大 | 探索模型推理边界 | ① 特殊系统 prompt + ② 完整 <think>...</think> + 答案 |
2 OPD 实现能力融合:
接着,核心步骤来了。如何将分散的专家能力无损地融合到一个统一模型中?答案就是On-Policy Distillation(在策略蒸馏)。
- 工作原理:OPD不是简单地混合模型权重,而是像一种更精妙的学习过程。统一的“学生”模型在自己的生成轨迹(即在策略)上,同时向多个“教师”专家模型学习。
- 关键操作:学生模型会计算自己与各个专家教师之间输出分布的反向KL散度,并将其作为损失函数来优化自身。这样,学生模型就能针对不同类型的任务(如数学题、编程题),动态地“对齐”并模仿最擅长该领域的专家老师的思考方式,从而将多个专家的能力整合进一个参数空间。
- trick:全词表蒸馏:计算损失时保留完整的词表概率分布,而非近似估计,这使训练更稳定,效果更好。高效的教师调度。
OPD 详解(也请参考 [LLM 算法岗 | 八股问答(3)· 强化学习与 RLHF](https://www.cnblogs.com/moonout/p/19749191#11-on-policy-distillationopd的-loss function 是什么如果不考虑全词表计算-KL-散度,可否将其写为-ratio--advantage-的形式)):
- gap:混合强化学习:让同一个学生模型,针对不同领域的奖励信号进行 RL 优化。这会导致“灾难性遗忘”,学生刚学会数学题,转头去学写代码,数学能力可能又变差了。不同任务的目标会互相干扰。
- 学生模型,针对同一个输入,去学习模仿“对于这个具体问题,教练会怎么想、怎么生成下一个词的概率分布”。
- \(L_{OPD} = \sum_{i=1}^N w_i\cdot D_{KL}(\pi_\theta \| \pi_{E_i})\),使用 反向 KL 散度。正向:要求学生在老师有高概率的地方也必须有高概率。反向:允许学生只专注于老师某个高概率的“模态”。
- on-policy:用学生模型 πθ 自身生成一个词元序列 y(on-policy)。将同一个序列 y 分别输入给学生模型和教师模型。计算两者在这个序列上的概率分布的 KL 散度。
- OPD 的 trick:全词表蒸馏 (Full-Vocabulary Distillation)
- 过去为了省算力,常把 KL 损失近似为 Token-Level 近似(类似 RL 中的 advantage 估计),也就是只对特定的输出 token 的概率进行计算(?)
- DeepSeek-V4 坚持使用 全词表精确 KL:保留教师模型在整个词表(128K+)上的完整概率分布形状。结果:梯度估计极其稳定,忠实还原教师知识,彻底规避了传统近似带来的训练震荡。
还有一些 FP4 量化感知训练(QAT)、高效教师调度(为了支撑全词表 OPD)、可抢占 + 容错的 Rollout 服务、沙箱基础设施 DSec(DeepSeek Elastic Compute)agentic AI 训练 / 评估构建的生产级沙箱平台 之类的 infra 优化。
3 evaluation
使用的标准 benchmark:
- 知识 & 推理(Knowledge & Reasoning):🟢 MMLU-Pro 多学科知识理解,研究生难度;🟢 GPQA Diamond 专家级科学问答,"谷歌证明"难度;🟢 SimpleQA-Verified 事实性知识检索,防数据污染;🟢 Chinese-SimpleQA 中文事实性知识评估;🟢 HLE (Humanity's Last Exam) 人类终极考试,高难度综合推理;🟢 LiveCodeBench-v6 代码生成能力,防污染设计;🟢 HMMT 2026 Feb 高中数学竞赛,形式化验证;🟢 IMOAnswerBench 国际奥赛级别数学推理;Apex / Apex Shortlist 高难度数学问题求解。
- 百万级长上下文(1M-Token Context):🟢 OpenAI MRCR 1M - 多针检索任务,8-needle 设置,测上下文信息定位能力;🟢 CorpusQA 1M - 真实长文档分析,10M token 语料级问答,更贴近实际场景。
- Agent 能力(Agentic Capabilities):🟢 Terminal Bench 2.0 - 命令行任务执行;🟢 SWE-Verified - 软件工程问题修复;🟢 SWE-Pro - 长程软件工程任务;🟢 SWE Multilingual - 多语言代码修复;🟢 BrowseComp - 搜索增强问答;🟢 HLE w/ tools - 工具增强推理;🟢 MCPAtlas Public - 多工具泛化能力;🟢 GDPval-AA - 经济价值任务;🟢 Toolathlon - 多工具协同。
4 DeepSeek v4 的 agent 相关
上下文管理上,跟 v3.2 的区别:
- 为 Agent 设计的上下文管理:模型引入了一种名为交错思维的策略来解决长程 Agent 工作流中的上下文浪费问题。
- 以往,新用户消息或工具调用后,模型可能会丢弃之前的思考,导致需要反复“重建认知”。
- 现在,所有思考内容都会在整个对话过程中被完整保留。
- (普通对话场景,不调 tool 的对话:新用户消息到达时丢弃旧推理内容,保持上下文简洁)
全新的工具调用范式:
- 模型采用了一套基于 XML 的 DSML 标签进行工具调用。总之就是不用 json 了。kimi 也用 typescript 了。
- 采用 XML 格式 + 特殊
\|DSML\|token,显著减少转义错误和工具调用失败。

浙公网安备 33010602011771号