DeepSeek-V4.1 Flash 凭什么登顶 OpenRouter ?

DeepSeek V4.1 Flash 凭什么登顶 OpenRouter?四周用量数据背后的五个信号

数据截至 2026 年 10 月 8 日。调用量取自 OpenRouter 公开周榜(Source: OpenRouter, openrouter.ai/rankings),能力分与输出速度取自 Artificial Analysis 独立评测,价格取自各厂商官网与 OpenRouter 模型目录,美元按 1 USD = 6.7046 CNY(2026-10-07,欧洲央行)折算。数据由大模型选型平台 ModelSage(modelsage.cn)整理。

2026 年 9 月 10 日,DeepSeek 发布 V4.1 Flash。发布后的第一个完整周,它就成为 OpenRouter 上调用量最大的模型,四周之内周用量从 4.94 万亿 token 涨到 25.61 万亿 token。

但如果只看评测榜,它并不起眼:在 Artificial Analysis 综合能力分上,V4.1 Flash 得 68.5 分,在 384 个模型中排第 60 位。同价位里,智谱的 GLM-5.3-Flash 综合分更高、价格更低。

一个在能力榜上处于中游的模型,为什么会成为开发者实际花钱最多的模型?这个现象说明了大模型市场的哪些变化?本文用三组数据来回答:OpenRouter 四周用量、Artificial Analysis 独立评测、官方价格结构。

一、先说清楚:OpenRouter 的数据能说明什么、不能说明什么

OpenRouter 是一个模型聚合网关,开发者用一个 API Key 调用几百个模型,平台公开每周各模型的 token 用量。这是目前少有的、反映「开发者真实付费选择」的公开数据。

使用这份数据之前,有三个边界必须交代:

  1. 它只是一个网关的数据,不是全球市场份额。 各厂商官方 API 直连、Azure / Bedrock 等云平台、国内的百炼 / 火山方舟等渠道,都不在统计范围内。例如 Anthropic 在这四周里只占 OpenRouter 用量的 3.0%~3.3%,这显然不是它在 API 市场的真实地位。
  2. 它偏向价格敏感的开发者和 Agent 工作负载。 网关有加价,大客户通常直签原厂。
  3. 它适合看趋势和同类比较。 同一个网关上,谁涨谁跌是可信的;不同模型之间的相对高低也可比。

本文的所有结论都在这个边界内讨论。

二、四周发生了什么

DeepSeek V4.1 Flash 上线后四周的 OpenRouter 用量

DeepSeek V4.1 Flash 上线后四周的 OpenRouter 用量

几个值得注意的细节:

  • 第一个完整周就登顶。 09-14 那一周,V4.1 Flash 的 15.77 万亿已经超过了自家上一代 V4 Flash(14.30 万亿),用户迁移只用了一周。
  • 增长没有停。 09-14 到 09-28,周用量连续增长 24.2% 和 30.8%。
  • 09-28 周的第一名是一个匿名模型。 排名第一的 space-bunny-alpha 是 OpenRouter 上的「隐身模型」(厂商不公开身份的测试模型),周用量从 0.98 万亿跳到 38.66 万亿。这类模型通常以免费或低价方式投放,用量波动极大,不宜和正式商用模型直接比较。在署名的正式模型里,V4.1 Flash 仍然是第一。

再看 09-28 这一周的前十名:

OpenRouter 周用量前十(2026-09-28 周)

OpenRouter 周用量前十(2026-09-28 周)

前十名里,名字带 Flash 或 Luna(各家的轻量档)的有 6 个,合计 64.74 万亿 token,占全平台 39.0%。而各家旗舰模型的份额很低:Claude Opus 5.5 为 1.49%(排第 12),GPT-6 Astra 为 0.85%。

调用量最大的,不是能力最强的模型,而是轻量档模型。 这是理解 V4.1 Flash 现象的第一个前提。

三、V4.1 Flash 强在哪:单项都不是第一,组合却很少见

把 V4.1 Flash 和同档位的主要竞品放在一起:

轻量档主力模型横向对比

轻量档主力模型横向对比

注:能力分为 Artificial Analysis 指数按榜首 = 100 归一化,均取各模型最高推理档;混合价 = 输入 × 0.75 + 输出 × 0.25。V4.1 Flash 价格为 OpenRouter 目录价折算,与 DeepSeek 官网高峰价(2 元 / 8 元)基本一致。Claude Haiku 5.5 于 10 月 7 日发布,尚无速度实测数据。

这张表里有三个容易被忽略的事实。

第一,V4.1 Flash 在能力和价格上都不是第一。 GLM-5.3-Flash 综合分高 4.1 分、Agent 分高 3.5 分,混合价只有 V4.1 Flash 的 37%。如果只看「能力 ÷ 价格」,V4.1 Flash 不会胜出。

第二,它的速度在这一档里遥遥领先。 216.1 token/s 是 GLM-5.3-Flash 的 4.2 倍、MiMo-V2.6-Flash 的 3.8 倍、GPT-6 Luna 的 1.7 倍。

第三,「能力够用」和「速度快」同时成立的模型非常少。 在 Artificial Analysis 有速度数据、且 Agent 分 ≥ 75 的 36 个模型中,V4.1 Flash 速度排第 2,排第 1 的是它自己的前代 V4 Flash Vision(221 token/s,已下线)。排在它后面的是 Claude Sonnet 5.5(125 token/s),而后者的混合价是它的 7.6 倍。

换句话说,V4.1 Flash 占据的是一个几乎没有对手的位置:Agent 能力进入第一梯队的下沿,速度却是轻量模型的水平,价格是轻量档的价格。

它和自家产品的对比也说明问题:V4.1 Flash 综合分比上一代 V4 Flash 0731 高 8.9 分、Agent 分高 12.3 分,价格不变;同时综合分比自家更大的 V4 Pro 0813 还高 6.0 分,混合价只有后者的 26%。小号超过大号,这在 DeepSeek 的产品线上是第一次。

DeepSeek 官方公布的基准也指向同一方向(以下为厂商自报,非独立评测):

DeepSeek 三代模型官方 Agent 基准对比(厂商自报)

DeepSeek 三代模型官方 Agent 基准对比(厂商自报)

五项 Agent 类基准,V4.1 Flash 全部超过 V4 Pro 0813。其中 Automation-Bench 从 25.1 提高到 54.8,翻了一倍多。

四、为什么偏偏是 Agent 场景放大了这个优势

以下是基于数据的分析判断。

1. Agent 任务是长链路,速度差会被逐步累积。

聊天场景下,每秒 50 token 和每秒 200 token 的差别,用户感知并不强烈。但 Agent 任务是「思考 → 调用工具 → 读结果 → 再思考」的串行循环,一个编程任务可能有几十上百轮,每一轮都要等模型输出完才能进入下一步。

按 Artificial Analysis 实测速度做个换算:同样输出 10 万 token,V4.1 Flash 的纯生成时间约 7.7 分钟,GLM-5.3-Flash 约 32.4 分钟。这还没有算首字延迟和工具执行时间,只是生成部分。对于需要开发者在旁边等待的编程 Agent,这就是「几分钟搞定」和「去喝杯咖啡」的区别。

2. Agent 反复携带长上下文,缓存价格比标价更重要。

Agent 每一轮都要把之前的对话、代码、工具结果带上,输入 token 中有大量重复内容。DeepSeek 的定价结构在这一点上非常激进:

DeepSeek 官方 API 价格(元 / 百万 token)

DeepSeek 官方 API 价格(元 / 百万 token)

注:高峰时段为北京时间工作日 9:00–12:00、14:00–18:00,其余时段(含周末和法定节假日)为空闲时段,价格减半。deepseek-flash 当前对应 V4.1 Flash。

缓存命中价只有未命中价的 1/50。对于上下文高度重复的 Agent 工作负载,实际账单主要由缓存命中价和输出价决定,标价里的「输入 2 元」反而不是重点。

3. 接入成本几乎为零。

V4.1 Flash 同时支持 OpenAI Chat Completions、OpenAI Responses 和 Anthropic 三种接口格式,官方文档专门提供了 Claude Code、Codex、OpenCode 等编程工具的接入说明。上一代的模型名 deepseek-v4-flash 被自动路由到 V4.1 Flash,老用户不改一行代码就完成了升级。

此外,V4.1 Flash 原生支持图像理解,上下文 1M、最大输出 384K。原来需要在 V4 Flash 和 V4 Flash Vision 之间切换的场景,现在一个模型就能覆盖。

五、开放权重带来的分发效应

V4.1 Flash 是开放权重模型,任何云厂商都可以自行部署并在 OpenRouter 上提供服务。10 月 8 日查询 OpenRouter 模型目录,各模型的服务商数量差异很大:

OpenRouter 上的服务商数量(2026-10-08 查询)

OpenRouter 上的服务商数量(2026-10-08 查询)

服务商多意味着三件事:

  • 价格被打穿。 V4.1 Flash 在 OpenRouter 上报价最低的一家服务商为每百万 token 输入 0.04 美元、输出 0.14 美元(约 0.27 元 / 0.94 元),DeepSeek 自营端点为 0.15 / 0.60 美元,最高一家为 0.45 / 1.80 美元,高低相差 10 倍以上。
  • 可用性更高。 一家服务商限流或故障,网关可以自动切换到另一家。
  • 吞吐更大。 几十家同时部署,总容量远超任何单一厂商。

但要注意,开放权重是必要条件,不是充分条件。GLM-5.3-Flash 的服务商更多、价格更低,但 09-28 这一周它的用量从 16.32 万亿跌到 9.73 万亿,下降 40.4%。开放权重让模型更容易被用起来,但最终用量仍然取决于模型本身在实际任务中的表现。

六、这说明了什么:五个信号

信号一:用量和榜单正在脱钩。

能力榜第一的模型(Claude Opus 5.5)在 OpenRouter 上只占 1.49%,综合分排第 60 的 V4.1 Flash 占 15.44%。开发者的实际选择标准不是「最强」,而是「完成任务的总成本最低」——这个成本包括价格、token 消耗和等待时间。

信号二:Agent 时代,速度成为一级指标。

过去选型主要看能力和价格两个维度。当主要工作负载从对话变成 Agent 后,速度直接决定了任务完成时间和开发者体验。V4.1 Flash 的胜出,在很大程度上是「速度」这个维度被重新定价的结果。

信号三:国产模型在网关上形成了结构性优势。

按厂商统计 OpenRouter 前 50 名模型,扣除匿名模型后,DeepSeek、智谱、腾讯、小米、月之暗面、MiniMax、通义等国内厂商的合计份额在这四周分别为 58.5%、63.9%、60.9%、59.5%。再次强调,这只是一个网关上的数据,不代表全球市场份额;但它说明在价格敏感的开发者群体中,国产模型已经是默认选项之一。

信号四:迭代速度决定用量的持续性。

DeepSeek V4 Flash 从 4 月 24 日发布,到 7 月 31 日更新、9 月 10 日推出 V4.1,四个半月三个版本。每一次更新,用户迁移都很快,V4.1 Flash 发布后一周就超过了前代。在这个市场,用量不是一次性赢得的,需要持续迭代来维持。

信号五:价格战从「降标价」转向「结构性定价」。

峰谷定价(空闲时段半价)、极低的缓存命中价、OpenRouter 上的批处理档(V4.1 Flash batch 档为 0.112 / 0.336 美元),这些都不体现在标价上,却决定了大规模使用时的真实成本。比较价格只看标价,已经不够了。

七、趋势判断

以下是基于现有数据的判断,不是预测数据,读者可以在后续几周的数据中验证。

1. DeepSeek 新架构的更大尺寸模型大概率会推出。 官方在 V4.1 Flash 的发布说明中写道,这是「全新模型结构系列中的最小尺寸的模型」,设计初衷是「能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型」。如果最小尺寸已经在官方 Agent 基准上全面超过 V4 Pro,同架构的更大模型值得关注。

2. 闭源厂商的轻量档会正面反击。 OpenAI 的 GPT-6 Luna(9 月 22 日发布)在 OpenRouter 上的标价为 0.10 / 0.50 美元,前两周用量从 2.86 万亿涨到 6.18 万亿;Anthropic 的 Claude Haiku 5.5 在 10 月 7 日发布,标价同样是 0.10 / 0.50 美元,综合分 75.3。两者的标价都低于 V4.1 Flash 的 0.30 / 1.20 美元,接下来几周的用量变化,将检验闭源轻量模型能否夺回份额。

3. 速度会成为下一轮竞争的焦点。 V4.1 Flash 证明了「够用 + 快」的组合有巨大需求。可以预期,其他厂商的轻量档会在推理速度上投入更多,Artificial Analysis 等评测机构的速度数据也会被更多开发者纳入选型。

4. 排行榜的波动会更大。 匿名测试模型可以在两周内拿下 23% 的份额,新模型发布后一周就能登顶。看 OpenRouter 数据,应该看多周趋势,不宜用单周排名下结论。

八、给选型者的建议

  1. 按任务分层,而不是全量使用一个模型。 大部分常规 Agent 步骤可以交给 V4.1 Flash 这类「快且够用」的模型,少数高难度步骤再路由到旗舰模型。
  2. 评估时加入速度维度。 对比候选模型时,除了能力分和价格,还要看输出速度和首字延迟,特别是对编程 Agent 等需要人等待的场景。
  3. 算真实成本,而不是标价。 把缓存命中率、峰谷时段、推理档位的 token 消耗都算进去。离线批处理任务可以安排在空闲时段,直接节省一半费用。
  4. 开放权重模型要比较服务商。 同一个模型在不同服务商处价格可能相差 10 倍,但部署配置、上下文长度和稳定性也可能不同,上线前应在候选服务商上实测。
  5. 用自己的业务数据做最终验证。 公开评测和网关用量只能缩小范围,抽取几十条真实请求在两三个候选模型上跑一遍,才能得出可靠结论。

各模型的能力分、输出速度、价格以及 OpenRouter 周用量趋势,可在大模型选型平台 ModelSage(modelsage.cn)的排行榜、价格页和趋势页中查看,数据每日自动更新。

数据来源:OpenRouter 公开周榜(Source: OpenRouter, openrouter.ai/rankings,CC BY 4.0)与模型目录;Artificial Analysis(能力分、输出速度);DeepSeek 官方 API 文档(价格、更新日志、厂商自报基准);欧洲央行汇率。整理于 2026 年 10 月 8 日。

posted @ 2026-10-08 22:28  sc00001  阅读(12)  评论(0)    收藏  举报