DeepSeek V4 快速上手测评
前言
今天上午,DeepSeek 官方通过微信公众号发布了 DeepSeek V4 系列模型,包括 DeepSeek-V4-Flash 和 DeepSeek-V4-Pro。这次发布最引人注目的几个点:1M 上下文窗口、国产芯片适配带来的极低推理成本,以及官宣中提到的"对标世界一线模型"的智力水平。
发布公告原文:DeepSeek V4 发布
作为一个 DeepSeek 老粉,我自然第一时间就上手开测了。这篇文章记录我的测试环境、配置过程和三个实际任务的测评结果。
测试环境与配置
我使用的客户端是 opencode v1.14.22。由于发布初期 opencode 官方的 provider 配置还没来得及更新,客户端里仍然只有 DeepSeek Chat 和 DeepSeek Reasoner 两个选项(虽然这两个选项现在默认已经接入了 V4-Flash 的非思考/思考模式,但上下文仍然限制在 128K)。
为了充分发挥 V4 的 1M 上下文能力,我手动添加了第三方 provider 配置,参照 opencode 官方文档 - Providers,在 ~/.config/opencode.json 的 provider 条目中添加了如下配置:
"provider": {
"deepseek": {
"npm": "@ai-sdk/openai-compatible",
"name": "DeepSeek",
"options": {
"baseURL": "https://api.deepseek.com/v1",
"apiKey": "{YOUR API KEY}"
},
"models": {
"deepseek-v4-flash": {
"name": "deepseek-v4-flash",
"limit": {
"context": 1000000,
"output": 393216
},
"modalities": {
"input": ["text"],
"output": ["text"]
},
"variants": {
"think-high": {
"reasoning": true,
"reasoningEffort": "high",
"interleaved": { "field": "reasoning_content" }
},
"think-max": {
"reasoning": true,
"reasoningEffort": "max",
"interleaved": { "field": "reasoning_content" }
}
}
},
"deepseek-v4-pro": {
"name": "deepseek-v4-pro",
"limit": {
"context": 1000000,
"output": 393216
},
"modalities": {
"input": ["text"],
"output": ["text"]
},
"variants": {
"think-high": {
"reasoning": true,
"reasoningEffort": "high",
"interleaved": { "field": "reasoning_content" }
},
"think-max": {
"reasoning": true,
"reasoningEffort": "max",
"interleaved": { "field": "reasoning_content" }
}
}
}
}
}
}
配置完成后就可以在 opencode 中直接选择 deepseek-v4-flash 和 deepseek-v4-pro 模型,并享受到 1M 上下文 和 think-high / think-max 两个推理强度变体。
测评任务与结果
我设计了三个覆盖不同能力维度的测试任务,对标目前我心目中国产模型的 SOTA——GLM-5.1,DS V4我选的是Flash加think-high的配置。
任务一:生成 SOC 架构图 SVG
让模型自行构思一个 SOC 芯片的架构设计方案,并生成对应的架构图 SVG。
DS V4 表现: 大部分时候生成的 SVG 存在明显问题——连线错位、模块布局不合理、部分元素渲染异常。偶尔能 roll 出几个还说得过去的版本,和GLM-5.1质量接近,但一致性较差。
GLM-5.1 表现: 一直保持稳定高质量的输出,布局合理、连线清晰、标注完整。
结论: 在这个任务上,DS V4 明显差于 GLM-5.1。
任务二:读取 Coral NPU 完整项目并生成项目报告
让模型读取 Coral NPU 的整个工程代码,分析架构后生成一份完整的项目技术报告。这个任务考验的是长上下文处理能力和代码理解能力。
DS V4 表现: 表现优异,对项目结构、模块设计、数据流都有深入的分析,报告质量很高。
GLM-5.1 表现: 同样表现不错,但细节丰富度和分析深度略逊一筹。
结论: DS V4 优于 GLM-5.1,可以说是目前国产模型在这个任务上的 SOTA。
任务三:根据大纲生成 50 页长 PPT
给定一个详细的大纲,让模型生成一个 50 页左右的 PPT 演示文稿。这个任务考验的是长文本的结构化生成能力和内容组织的连贯性。
DS V4 表现: 能较好地跟随大纲结构,内容组织合理,生成质量稳定。
GLM-5.1 表现: 同样表现稳定,二者差距不大。
结论: 二者基本 平齐,没有明显的高下之分。
速度:最让我震撼的一点
如果说智力层面的表现是"符合预期",那 DS V4 的速度就是远超预期。
在任务二(读取完整项目生成报告)中,我实测了耗时:
| 模型 | 耗时 |
|---|---|
| DS V4 | 约 3 分钟 |
| GLM-5.1 | 约 11 分钟 |
差了将近 4 倍。 这意味着在实际使用中,DS V4 的响应几乎不需要等待,交互体验非常流畅。这种速度优势应当来源于 DeepSeek 对国产芯片的适配优化,使得推理成本大幅降低的同时还能保持极高的吞吐量。
总体评价
DeepSeek V4 满足了我对它的所有期待:
- ✅ 1M 上下文窗口——是目前国产模型中最长的,实际体验中确实能完整处理大型项目
- ✅ 一线智力水平——在代码理解、项目分析等任务上达到了国产模型的 SOTA 水平
- ✅ 价格低廉——基于国产芯片的推理优化使得成本控制非常优秀
- ✅ 速度奇快——这是我体验过的最快的国产顶级模型,没有之一
当然,它也不是完美的:
- ❌ SVG 等结构化生成任务表现较差,与 GLM-5.1 有差距
- ❌ 使用稳定性还有待提升,偶尔会出现生成质量波动
- ❌ 还没有coding plan之类的付费方式,目前大规模使用很烧钱
但总体来看,DS V4 的发布是一个非常积极的信号。它证明了国产模型完全可以在上下文长度、推理速度和智力水平这三个维度上同时达到世界一流水平。我完全可以期待后续的升级优化,以及 GLM、Qwen、Kimi 等其他国产模型厂商的 follow-up。
我仿佛看到了整个国产模型进入 1M 上下文时代在向我招手。
太爽了,真的。
2026年4月25日重大更新:opencode v1.14.24 版本,可订阅opencode go,DeepSeek V4 版本已正式上线。
2026年4月27日重大更新:官方api输入命中缓存打一折了,直接支持官网就完事了,D圣的恩情还不完。
2026年4月28日重大更新:opencode已可以直接使用/connect连接官方api的DeepSeek V4,但有时会出现reasoning content相关的api bug,期待后续修复
本文由 Yiyang Yuan 提供内容与校验,DeepSeek-V4 负责写稿。

浙公网安备 33010602011771号