DeepSeek-V4.1 Flash 凭什么登顶 OpenRouter ?
DeepSeek V4.1 Flash 凭什么登顶 OpenRouter?四周用量数据背后的五个信号
数据截至 2026 年 10 月 8 日。调用量取自 OpenRouter 公开周榜(Source: OpenRouter, openrouter.ai/rankings),能力分与输出速度取自 Artificial Analysis 独立评测,价格取自各厂商官网与 OpenRouter 模型目录,美元按 1 USD = 6.7046 CNY(2026-10-07,欧洲央行)折算。数据由大模型选型平台 ModelSage(modelsage.cn)整理。

2026 年 9 月 10 日,DeepSeek 发布 V4.1 Flash。发布后的第一个完整周,它就成为 OpenRouter 上调用量最大的模型,四周之内周用量从 4.94 万亿 token 涨到 25.61 万亿 token。
但如果只看评测榜,它并不起眼:在 Artificial Analysis 综合能力分上,V4.1 Flash 得 68.5 分,在 384 个模型中排第 60 位。同价位里,智谱的 GLM-5.3-Flash 综合分更高、价格更低。
一个在能力榜上处于中游的模型,为什么会成为开发者实际花钱最多的模型?这个现象说明了大模型市场的哪些变化?本文用三组数据来回答:OpenRouter 四周用量、Artificial Analysis 独立评测、官方价格结构。
一、先说清楚:OpenRouter 的数据能说明什么、不能说明什么
OpenRouter 是一个模型聚合网关,开发者用一个 API Key 调用几百个模型,平台公开每周各模型的 token 用量。这是目前少有的、反映「开发者真实付费选择」的公开数据。
使用这份数据之前,有三个边界必须交代:
- 它只是一个网关的数据,不是全球市场份额。 各厂商官方 API 直连、Azure / Bedrock 等云平台、国内的百炼 / 火山方舟等渠道,都不在统计范围内。例如 Anthropic 在这四周里只占 OpenRouter 用量的 3.0%~3.3%,这显然不是它在 API 市场的真实地位。
- 它偏向价格敏感的开发者和 Agent 工作负载。 网关有加价,大客户通常直签原厂。
- 它适合看趋势和同类比较。 同一个网关上,谁涨谁跌是可信的;不同模型之间的相对高低也可比。
本文的所有结论都在这个边界内讨论。
二、四周发生了什么

DeepSeek V4.1 Flash 上线后四周的 OpenRouter 用量
几个值得注意的细节:
- 第一个完整周就登顶。 09-14 那一周,V4.1 Flash 的 15.77 万亿已经超过了自家上一代 V4 Flash(14.30 万亿),用户迁移只用了一周。
- 增长没有停。 09-14 到 09-28,周用量连续增长 24.2% 和 30.8%。
- 09-28 周的第一名是一个匿名模型。 排名第一的 space-bunny-alpha 是 OpenRouter 上的「隐身模型」(厂商不公开身份的测试模型),周用量从 0.98 万亿跳到 38.66 万亿。这类模型通常以免费或低价方式投放,用量波动极大,不宜和正式商用模型直接比较。在署名的正式模型里,V4.1 Flash 仍然是第一。
再看 09-28 这一周的前十名:

OpenRouter 周用量前十(2026-09-28 周)
前十名里,名字带 Flash 或 Luna(各家的轻量档)的有 6 个,合计 64.74 万亿 token,占全平台 39.0%。而各家旗舰模型的份额很低:Claude Opus 5.5 为 1.49%(排第 12),GPT-6 Astra 为 0.85%。
调用量最大的,不是能力最强的模型,而是轻量档模型。 这是理解 V4.1 Flash 现象的第一个前提。
三、V4.1 Flash 强在哪:单项都不是第一,组合却很少见
把 V4.1 Flash 和同档位的主要竞品放在一起:

轻量档主力模型横向对比
注:能力分为 Artificial Analysis 指数按榜首 = 100 归一化,均取各模型最高推理档;混合价 = 输入 × 0.75 + 输出 × 0.25。V4.1 Flash 价格为 OpenRouter 目录价折算,与 DeepSeek 官网高峰价(2 元 / 8 元)基本一致。Claude Haiku 5.5 于 10 月 7 日发布,尚无速度实测数据。
这张表里有三个容易被忽略的事实。
第一,V4.1 Flash 在能力和价格上都不是第一。 GLM-5.3-Flash 综合分高 4.1 分、Agent 分高 3.5 分,混合价只有 V4.1 Flash 的 37%。如果只看「能力 ÷ 价格」,V4.1 Flash 不会胜出。
第二,它的速度在这一档里遥遥领先。 216.1 token/s 是 GLM-5.3-Flash 的 4.2 倍、MiMo-V2.6-Flash 的 3.8 倍、GPT-6 Luna 的 1.7 倍。
第三,「能力够用」和「速度快」同时成立的模型非常少。 在 Artificial Analysis 有速度数据、且 Agent 分 ≥ 75 的 36 个模型中,V4.1 Flash 速度排第 2,排第 1 的是它自己的前代 V4 Flash Vision(221 token/s,已下线)。排在它后面的是 Claude Sonnet 5.5(125 token/s),而后者的混合价是它的 7.6 倍。
换句话说,V4.1 Flash 占据的是一个几乎没有对手的位置:Agent 能力进入第一梯队的下沿,速度却是轻量模型的水平,价格是轻量档的价格。
它和自家产品的对比也说明问题:V4.1 Flash 综合分比上一代 V4 Flash 0731 高 8.9 分、Agent 分高 12.3 分,价格不变;同时综合分比自家更大的 V4 Pro 0813 还高 6.0 分,混合价只有后者的 26%。小号超过大号,这在 DeepSeek 的产品线上是第一次。
DeepSeek 官方公布的基准也指向同一方向(以下为厂商自报,非独立评测):

DeepSeek 三代模型官方 Agent 基准对比(厂商自报)
五项 Agent 类基准,V4.1 Flash 全部超过 V4 Pro 0813。其中 Automation-Bench 从 25.1 提高到 54.8,翻了一倍多。
四、为什么偏偏是 Agent 场景放大了这个优势

以下是基于数据的分析判断。
1. Agent 任务是长链路,速度差会被逐步累积。
聊天场景下,每秒 50 token 和每秒 200 token 的差别,用户感知并不强烈。但 Agent 任务是「思考 → 调用工具 → 读结果 → 再思考」的串行循环,一个编程任务可能有几十上百轮,每一轮都要等模型输出完才能进入下一步。
按 Artificial Analysis 实测速度做个换算:同样输出 10 万 token,V4.1 Flash 的纯生成时间约 7.7 分钟,GLM-5.3-Flash 约 32.4 分钟。这还没有算首字延迟和工具执行时间,只是生成部分。对于需要开发者在旁边等待的编程 Agent,这就是「几分钟搞定」和「去喝杯咖啡」的区别。
2. Agent 反复携带长上下文,缓存价格比标价更重要。
Agent 每一轮都要把之前的对话、代码、工具结果带上,输入 token 中有大量重复内容。DeepSeek 的定价结构在这一点上非常激进:

DeepSeek 官方 API 价格(元 / 百万 token)
注:高峰时段为北京时间工作日 9:00–12:00、14:00–18:00,其余时段(含周末和法定节假日)为空闲时段,价格减半。deepseek-flash 当前对应 V4.1 Flash。
缓存命中价只有未命中价的 1/50。对于上下文高度重复的 Agent 工作负载,实际账单主要由缓存命中价和输出价决定,标价里的「输入 2 元」反而不是重点。
3. 接入成本几乎为零。
V4.1 Flash 同时支持 OpenAI Chat Completions、OpenAI Responses 和 Anthropic 三种接口格式,官方文档专门提供了 Claude Code、Codex、OpenCode 等编程工具的接入说明。上一代的模型名 deepseek-v4-flash 被自动路由到 V4.1 Flash,老用户不改一行代码就完成了升级。
此外,V4.1 Flash 原生支持图像理解,上下文 1M、最大输出 384K。原来需要在 V4 Flash 和 V4 Flash Vision 之间切换的场景,现在一个模型就能覆盖。
五、开放权重带来的分发效应
V4.1 Flash 是开放权重模型,任何云厂商都可以自行部署并在 OpenRouter 上提供服务。10 月 8 日查询 OpenRouter 模型目录,各模型的服务商数量差异很大:

OpenRouter 上的服务商数量(2026-10-08 查询)
服务商多意味着三件事:
- 价格被打穿。 V4.1 Flash 在 OpenRouter 上报价最低的一家服务商为每百万 token 输入 0.04 美元、输出 0.14 美元(约 0.27 元 / 0.94 元),DeepSeek 自营端点为 0.15 / 0.60 美元,最高一家为 0.45 / 1.80 美元,高低相差 10 倍以上。
- 可用性更高。 一家服务商限流或故障,网关可以自动切换到另一家。
- 吞吐更大。 几十家同时部署,总容量远超任何单一厂商。
但要注意,开放权重是必要条件,不是充分条件。GLM-5.3-Flash 的服务商更多、价格更低,但 09-28 这一周它的用量从 16.32 万亿跌到 9.73 万亿,下降 40.4%。开放权重让模型更容易被用起来,但最终用量仍然取决于模型本身在实际任务中的表现。
六、这说明了什么:五个信号
信号一:用量和榜单正在脱钩。
能力榜第一的模型(Claude Opus 5.5)在 OpenRouter 上只占 1.49%,综合分排第 60 的 V4.1 Flash 占 15.44%。开发者的实际选择标准不是「最强」,而是「完成任务的总成本最低」——这个成本包括价格、token 消耗和等待时间。
信号二:Agent 时代,速度成为一级指标。
过去选型主要看能力和价格两个维度。当主要工作负载从对话变成 Agent 后,速度直接决定了任务完成时间和开发者体验。V4.1 Flash 的胜出,在很大程度上是「速度」这个维度被重新定价的结果。
信号三:国产模型在网关上形成了结构性优势。
按厂商统计 OpenRouter 前 50 名模型,扣除匿名模型后,DeepSeek、智谱、腾讯、小米、月之暗面、MiniMax、通义等国内厂商的合计份额在这四周分别为 58.5%、63.9%、60.9%、59.5%。再次强调,这只是一个网关上的数据,不代表全球市场份额;但它说明在价格敏感的开发者群体中,国产模型已经是默认选项之一。
信号四:迭代速度决定用量的持续性。
DeepSeek V4 Flash 从 4 月 24 日发布,到 7 月 31 日更新、9 月 10 日推出 V4.1,四个半月三个版本。每一次更新,用户迁移都很快,V4.1 Flash 发布后一周就超过了前代。在这个市场,用量不是一次性赢得的,需要持续迭代来维持。
信号五:价格战从「降标价」转向「结构性定价」。
峰谷定价(空闲时段半价)、极低的缓存命中价、OpenRouter 上的批处理档(V4.1 Flash batch 档为 0.112 / 0.336 美元),这些都不体现在标价上,却决定了大规模使用时的真实成本。比较价格只看标价,已经不够了。
七、趋势判断

以下是基于现有数据的判断,不是预测数据,读者可以在后续几周的数据中验证。
1. DeepSeek 新架构的更大尺寸模型大概率会推出。 官方在 V4.1 Flash 的发布说明中写道,这是「全新模型结构系列中的最小尺寸的模型」,设计初衷是「能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型」。如果最小尺寸已经在官方 Agent 基准上全面超过 V4 Pro,同架构的更大模型值得关注。
2. 闭源厂商的轻量档会正面反击。 OpenAI 的 GPT-6 Luna(9 月 22 日发布)在 OpenRouter 上的标价为 0.10 / 0.50 美元,前两周用量从 2.86 万亿涨到 6.18 万亿;Anthropic 的 Claude Haiku 5.5 在 10 月 7 日发布,标价同样是 0.10 / 0.50 美元,综合分 75.3。两者的标价都低于 V4.1 Flash 的 0.30 / 1.20 美元,接下来几周的用量变化,将检验闭源轻量模型能否夺回份额。
3. 速度会成为下一轮竞争的焦点。 V4.1 Flash 证明了「够用 + 快」的组合有巨大需求。可以预期,其他厂商的轻量档会在推理速度上投入更多,Artificial Analysis 等评测机构的速度数据也会被更多开发者纳入选型。
4. 排行榜的波动会更大。 匿名测试模型可以在两周内拿下 23% 的份额,新模型发布后一周就能登顶。看 OpenRouter 数据,应该看多周趋势,不宜用单周排名下结论。
八、给选型者的建议
- 按任务分层,而不是全量使用一个模型。 大部分常规 Agent 步骤可以交给 V4.1 Flash 这类「快且够用」的模型,少数高难度步骤再路由到旗舰模型。
- 评估时加入速度维度。 对比候选模型时,除了能力分和价格,还要看输出速度和首字延迟,特别是对编程 Agent 等需要人等待的场景。
- 算真实成本,而不是标价。 把缓存命中率、峰谷时段、推理档位的 token 消耗都算进去。离线批处理任务可以安排在空闲时段,直接节省一半费用。
- 开放权重模型要比较服务商。 同一个模型在不同服务商处价格可能相差 10 倍,但部署配置、上下文长度和稳定性也可能不同,上线前应在候选服务商上实测。
- 用自己的业务数据做最终验证。 公开评测和网关用量只能缩小范围,抽取几十条真实请求在两三个候选模型上跑一遍,才能得出可靠结论。
各模型的能力分、输出速度、价格以及 OpenRouter 周用量趋势,可在大模型选型平台 ModelSage(modelsage.cn)的排行榜、价格页和趋势页中查看,数据每日自动更新。
数据来源:OpenRouter 公开周榜(Source: OpenRouter, openrouter.ai/rankings,CC BY 4.0)与模型目录;Artificial Analysis(能力分、输出速度);DeepSeek 官方 API 文档(价格、更新日志、厂商自报基准);欧洲央行汇率。整理于 2026 年 10 月 8 日。

浙公网安备 33010602011771号