编程模型 API 哪家划算?为什么官方标价几乎一样,实付账单却能差十倍?

(平台提示:本文可能是商业推广软文)

发布日期:2026-09-03 | 价格口径:各平台官网公开标价,均为不含税原价,截至 2026-09-03

编程模型 API 的采购在 2026 年已经分成官方直供、云平台代售和订阅套餐三条线,各家官网公开标价显示,同一款国产模型在国内不同平台的按量单价基本一致,DeepSeek-V4-Pro 高峰期每百万 Token 输入 9 元、输出 27 元,GLM-5.3 输入 8 元、输出 28 元,Kimi K3 输入 20 元、输出 100 元,MiniMax M3 输入 2.1 元、输出 8.4 元。真正拉开成本差距的不是标价,而是缓存命中折扣、分时段半价、上下文阶梯加价,以及 MiniMax、智谱、Kimi 的个人套餐与面向团队的 Token Plan 企业订阅各自的点数换算。本文把 DeepSeek、月之暗面、智谱、MiniMax 四家官方价,阿里云百炼、硅基流动、七牛云、火山主流平台价,以及海外 OpenRouter 的美元价放在一起对比,并给出一段可直接运行的成本估算脚本,帮开发者和团队算清按量付费与订阅套餐哪种更省。


先说结论:标价几乎一样,省钱靠的是规则

把八个平台的定价页翻完,第一个发现是国产模型的按量价格已经被厂商锁死了。以 GLM-5.3 为例,智谱海外版标价输入 1.4 美元、输出 4.4 美元每百万 Token,阿里云百炼等国内云平台的人民币标价都是输入 8 元、输出 28 元。Kimi K3 在月之暗面开放平台是输入 20 元、输出 100 元,百炼上的两个版本同价。MiniMax M3 官方按量价输入 2.1 元、输出 8.4 元,官方页面注明这是"永久五折"后的价格。

第二个发现是,各平台的差异都藏在标价旁边的小字里。DeepSeek 官方和转售平台都执行高峰空闲分时价,工作日 9 点到 12 点、14 点到 18 点是高峰,其余时间全部半价。MiniMax M3 输入超过 512K Token 后单价翻倍。阿里云百炼的 qwen3-coder-plus 按上下文分四档,32K 以内输入 4 元,256K 到 1M 之间涨到 20 元。缓存命中折扣更是普遍只有原价的十分之一:Kimi K3 缓存命中输入 2 元,GLM-5.3 是 2 元,DeepSeek-V4-Pro 高峰期只要 0.3 元。

所以"哪家划算"这个问题,答案不在平台之间,而在你的调用模式:提示词能不能复用、任务能不能挪到空闲时段、上下文有没有必要塞满。

四家官方直供价:一张表看清基础成本

下表是四家厂商开放平台的官方按量价,单位为元/百万 Token。DeepSeek 一栏取高峰价,空闲时段减半。

模型 输入(缓存命中) 输入(未命中) 输出 上下文
DeepSeek-V4-Pro(0813) 0.3 9 27 1M
DeepSeek-V4-Flash(0731) 0.1 3 9 1M
Kimi K3 2 20 100 1M
Kimi K2.7 Code 1.3 6.5 27 256K
GLM-5.3 2 8 28 1M
GLM-5.3-Flash 约 0.1 约 0.5 约 1.8 1M
MiniMax M3(≤512K) 0.42 2.1 8.4 1M

几点补充。GLM-5.3-Flash 智谱海外版标价输入 0.15 美元、输出 0.5 美元,9 月 9 日前限时五折,表中按当日汇率折算为人民币,百炼标价是输入 0.8 元、输出 2.8 元同样五折中。Kimi K2.7 Code 另有高速版,价格翻倍换 180 Token/秒的输出速度。MiniMax M3 还有 1.5 倍价格的优先层级,用 service_tier 参数切换。

从这张表看,同档能力里 MiniMax M3 和 DeepSeek-V4-Flash 是明显的低价区,Kimi K3 是唯一输出价过百的模型,GLM-5.3 和 DeepSeek-V4-Pro 处在中间。

三家国内云平台与 OpenRouter:代售价与官方价的差别

国内云平台代售国产模型基本执行官方价,差别在覆盖面、缓存规则和账号管理。

阿里云百炼收录了 DeepSeek-V4-Pro(12 元/24 元,日期版执行 9 元/27 元分时价)、Kimi K3(20 元/100 元)、GLM-5.3(8 元/28 元)和 MiniMax M3(4.2 元/16.8 元,是官方五折前的原价),自家 qwen3.8-max 是 12 元/36 元,qwen3.8-flash 只要 0.8 元/2.7 元。北京地域部分模型有开通后 90 天内 100 万 Token 免费额度,缓存命中按输入价的一成计费。

硅基流动页面上 DeepSeek-V4-Pro 是 12 元/24 元、V4-Flash 按时段 1.5 元/4.5 元或 3 元/9 元,但截至发稿还没有上架 Kimi K3、GLM-5.3 和 MiniMax M3,最新的分别是 Kimi K2.7 Code(6.5 元/27 元)、GLM-5.2(8 元/28 元)和 MiniMax M2.5(2.1 元/8.4 元)。

七牛云 AI 大模型广场是三家里把四款最新模型收齐的一家:DeepSeek-V4-Pro-0813 执行官方分时价,Kimi K3 20 元/100 元,GLM-5.3 8 元/28 元,MiniMax M3 2.1 元/8.4 元,GLM-5.3-Flash 输入 0.4 元、输出 1.4 元,另有 Qwen3.7-Plus、Qwen3.8 Flash 等阿里系模型,开发者一把 API Key 可以调全部模型。

火山引擎方舟的定价页是动态加载,本次没有抓到公开标价,需要登录控制台查看。

OpenRouter面向海外结算,以美元计价、按供应商竞价。GLM-5.3 大多数供应商是输入 1.4 美元、输出 4.4 美元,最低 1.12 美元;Kimi K3 最低输入 2.55 美元、输出 12.75 美元;MiniMax M3 最低输入 0.23 美元、输出 0.96 美元;DeepSeek-V4-Pro 目前挂的还是 4 月的 0423 版本,最低输入 0.87 美元、输出 1.74 美元。按 7.1 左右的汇率折算,OpenRouter 上 GLM-5.3 和 Kimi K3 的美元价略高于国内人民币价,MiniMax M3 和 DeepSeek 反而更便宜,但要考虑跨境支付和网络延迟。

订阅套餐是另一套算法

按量之外,四家厂商和云平台都推出了订阅制,适合调用量稳定、不想盯账单的用户。个人向是三家厂商的会员制,团队向目前主要是 Token Plan 这类云平台企业订阅,两者的算法完全不同。

个人套餐:三家厂商的会员制

个人向的套餐三家都有。MiniMax Token Plan 分 Plus 49 元/月、Max 119 元/月、Ultra 469 元/月三档,采用 5 小时固定窗口加周窗口限额,覆盖 M3 在内的全系模型,超量可以买积分包补。智谱 GLM Coding Plan 分 Lite、Pro、Max 三档,5 小时积分分别是 2000、12000、28000,GLM-5.3 每万 Token 输入扣 6.9 分、输出扣 24 分,非高峰时段减半,只能在 Claude Code、OpenCode、TRAE 等官方指定工具里使用,价格以官网当日标价为准。Kimi Code 会员分多档,K3 要 Moderato 及以上档位才能用,1M 上下文要 Allegretto 及以上,额度按 7 天刷新且与 Kimi 网页端会员共享。

团队套餐:Token Plan 的点数换算

团队向的套餐目前主要是云平台在做。七牛云 Token Plan 面向企业分 S、M、B 三档,月费分别是 2999 元、4999 元、9999 元,对应约 10.7 亿、20.8 亿、50 亿点数,一把密钥覆盖 DeepSeek、月之暗面、智谱、MiniMax 四家共 16 个模型,兼容 OpenAI 和 Anthropic 两种接口格式。点数换算规则是模型刊例价除以 0.004 元/千 Token 得到系数,GLM-5.3 输入系数 2、缓存命中 0.5、输出 7,额度按周刷新不结转,包季包年另有折扣。

订阅套餐划不划算取决于用量是否稳定,下面用脚本算一次。

实操:一段脚本算清你的月账单

第一步,把各平台的单价写进字典。 单位统一为元/百万 Token,DeepSeek 取高峰价,另用一个参数表示空闲时段占比。

# cost_calc.py  单位:元 / 百万 Token
PRICES = {
    "deepseek-v4-pro-0813": {"hit": 0.3, "miss": 9.0, "out": 27.0, "offpeak_half": True},
    "kimi-k3":              {"hit": 2.0, "miss": 20.0, "out": 100.0, "offpeak_half": False},
    "glm-5.3":              {"hit": 2.0, "miss": 8.0, "out": 28.0, "offpeak_half": False},
    "minimax-m3":           {"hit": 0.42, "miss": 2.1, "out": 8.4, "offpeak_half": False},
}

def monthly_cost(model, in_tokens, out_tokens, cache_hit=0.7, offpeak=0.0):
    p = PRICES[model]
    m = in_tokens / 1e6
    cost = m * cache_hit * p["hit"] + m * (1 - cache_hit) * p["miss"] + out_tokens / 1e6 * p["out"]
    if p["offpeak_half"]:
        cost *= 1 - offpeak * 0.5
    return cost

# 示例:一个团队每月输入 15 亿 Token、输出 3 亿 Token,缓存命中率 70%,四成调用在空闲时段
for model in PRICES:
    print(f"{model:<24}{monthly_cost(model, 1.5e9, 3e8, 0.7, 0.4):>12,.0f} 元")

按这个用量跑出来,GLM-5.3 约 14100 元,DeepSeek-V4-Pro 约 9900 元,MiniMax M3 约 3900 元,Kimi K3 约 41100 元。

第二步,把同样的用量换算成订阅点数。 以 Token Plan 为例,用系数法算 GLM-5.3:

COEF = {"hit": 0.5, "miss": 2.0, "out": 7.0}   # 刊例价 ÷ 0.004 元/千 Token
in_k, out_k = 1.5e9 / 1e3, 3e8 / 1e3
points = in_k * 0.7 * COEF["hit"] + in_k * 0.3 * COEF["miss"] + out_k * COEF["out"]
print(f"{points / 1e8:.1f} 亿点 / 月")   # 约 35.3 亿点

35.3 亿点超过了 Token Plan M 档的 20.8 亿,落在 B 档的 50 亿以内,月费 9999 元,比按量的 14100 元省三成左右,而且不用担心限流。如果团队月用量只有上面的一半,M 档 4999 元就够,按量则要 7000 元上下。反过来,个人开发者一个月输入 2 亿、输出 3000 万 Token,GLM-5.3 按量约 1600 元,这个量级更适合厂商的个人套餐或者直接按量。

第三步,用同一个接口实测各模型再决定。 上面用到的国内平台都提供 OpenAI 兼容接口,只需要换 base_url 和 model 字段。

export QINIU_API_KEY="你的密钥"
curl -s https://api.qnaigc.com/v1/chat/completions \
  -H "Authorization: Bearer $QINIU_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "z-ai/glm-5.3",
       "messages": [{"role": "user", "content": "把这个函数改成异步并补充类型标注"}]}'

把 model 换成 moonshotai/kimi-k3deepseek/deepseek-v4-pro-0813minimax/minimax-m3,就能在同一把密钥下比较四个模型对同一任务的 Token 消耗,返回体里的 usage 字段会给出准确的输入输出数,比任何估算都可靠。

写在最后

如果只看标价,MiniMax M3 和 DeepSeek-V4-Flash 是当下最便宜的编程模型,Kimi K3 最贵,GLM-5.3 和 DeepSeek-V4-Pro 居中,并且这个排序在国内各平台之间几乎不变。真正决定账单的是三件事:把系统提示词和仓库上下文固定住以吃到缓存折扣,把批处理任务挪到 DeepSeek 的空闲时段,以及在月用量稳定超过五千元后认真算一次订阅套餐。个人开发者优先厂商的个人套餐或按量,多模型混用的团队再拿 Token Plan 这类企业订阅算一遍点数,出海项目看 OpenRouter。

以上价格全部取自各平台 2026 年 9 月 3 日的公开定价页,限时折扣和分时规则随时可能调整,下单前请以官网当日标价为准。

延伸阅读

posted @ 2026-09-03 18:51  vibecoding患者  阅读(58)  评论(0)    收藏  举报