Coding plan 越来越贵,也越来越慢了?
最近一阵子 codex 很慢,一个任务往往需要等几十分钟乃至上小时,完全不复当年 codex 敏捷的印象。另一个现象是身边同学在不断加大 token 投入,从早期的 Plus,到 Pro 10x 100 刀、Pro 20x 200 刀,甚至现在一个人 200 刀都不太够用。为什么 Coding plan 越来越贵,反而越来越慢了呢?
本文数据来源互联网、自己测试和身边同学反馈。
模型降价,时间涨价
按直觉,在相近的部署条件下,大模型能力更强,但推理更贵、更慢;小模型能力弱一些,换来更低的成本和更快的速度。然而自己测试时,却遇到了相反的组合:贵的模型快,便宜的模型反而慢。在自用的固定查文档 QA 任务里,对比同供应商不同体量的模型:智谱官方 Coding plan,GLM-5.3 完成任务约需 38 秒,Flash 约需 79 秒;GPT Pro 订阅,GPT-6 Astra 需要 87.8 秒,GPT-6.1 Sol 却需要 221.9 秒。再对比同一个模型的不同部署商,GLM-5.3-Flash 在 RunAnywhere 只需要 19 秒。[1]

推理成本和速度,不仅取决于模型大小,也取决于厂商推理资本设置和并发策略。 把多个请求组成 batch,共享权重读取等开销,可以摊低单位推理成本。但在机器数量一定时,更多请求共享算力,也可能增加排队和单个请求的生成时间。扩充机器能缓解压力,却要增加投入。[2]
9 月 29 日,Tibo 在 X 上说明,重新开放的 200 刀 Pro 将调整用量计算,按 API 支出折算,相当于旧方案的一半。[3]新倍率下 Plus 1x、Pro 100 的 5x、Pro 200 的 10x;同时强调基准用量增加,老用户暂时保留 20x,并获得额外额度。[4]他的解释是:GPT-6 Sol 和 Luna 的 API 价格已经降到此前的一半;随着模型效率和能力提高,同样的钱仍应能完成更多、更好的工作。 此外,不恢复五小时限制,还会加入不消耗现有额度的新功能。额度虽然减少,但模型降价、能力进步和附加服务,仍能让订阅更有价值。[3:1]


天下没有免费的午餐,API 降价的背后是用户的时间成本。 在 gpt-5.6-sol 最近 60 天的速度汇总为 95.69 token/s,最近 10 天为 29.66 token/s;gpt-5.6-terra 分别为 104.66 token/s 和 33.72 token/s。最近的数值早先大约三分之一。

Coding plan:不对等的算力预售
商品定价是表象,理解背后逻辑要深入推理服务建设成本。搭建数据中心到底需要多少钱?现有的 API / plan 服务是否能够盈利?以下是 agent 搜索网上公开部署记录,结合官方 API 定价和平均输入/输出/缓存率,假设资本投入仅包含算力成本和电力成本,不同负载率下的资本回本周期。[5][6][7][8][9][10]

这种测算方法虽然有着 infra 差异、系统组网维护成本统计缺失,但大致上还是相对乐观的回本周期,毕竟 coding plan 提高的额度远远高于等额 API 费用,一般是以大致10倍左右计费,也就是说 100刀订阅用满大致等值 1000刀的 API 服务。
在我看来,现阶段 token 的定价,更多由供给成本和市场竞争决定,还没有充分体现它为用户创造的价值。按 API 标价折算,Coding plan 似乎是一门不划算的生意。但厂商得到的可能不只是订阅费,还有持续的用户关系,以及在获得授权后积累的使用数据和反馈。填补闲置算力可以解释短期优惠,却不足以解释长期补贴:如果盈利始终无望,厂商也可以收缩后续推理投入。Coding plan 可以看作一种算力预售:以较低的价格锁定用户承诺,再从持续使用中争取数据和长期收益。 需求不足时,厂商愿意用优惠换取用户承诺;供不应求时,它就有动力收缩优惠,优先保证收入和容量。Token 作为商品还是那三个指标:智能、速度、成本,成本是实现规定,对客户最为敏感直观,变动成本相当较大;而智能和速度相对隐性,智能可以降智、路由到笨蛋模型,速度悄悄增大并发降速。预售锁定了用户的付款,却未必充分锁定厂商的交付。如果交付标准留有较大的调整空间,供需波动的代价,就更容易落到已经付款的用户身上。
从 token 到电力:风暴正在外溢
聊了这么多,说来说去都是“供需”这两个字。这几年 AI 这波浪潮真的是让我切身体会到了市场供需变化的为例,并且观察涨价有一条明晰市场扩散路径:从训练端,到面向企业的推理端(to B),再到未来更大规模的个人推理端(to C)。需求向外扩散,受到冲击的商品也在变化。
最早感受到的是训练端的算力竞争,显卡是最直接的稀缺资源,4090 一度成了增值品。那时,很多人感受到的 AI 成本,还是“买一张卡要花多少钱”。接着,需求从训练模型扩展到 to
B 推理侧。企业把推理接入业务,消耗从模型训练变成每天不断发生的调用。供需压力随之扩散到内存、我们购买的 token、plan 和 API 服务。对我来说,推理侧的变化更直接。2025 年 12 月,Opus 4.5 第一次让我意识到模型 coding 的能力。之后有一段时间,中转 GPT 5.4 基本随便用,一天挂着六七个 agent 跑一整晚,一个月也就几十块钱。2026 年 3 月 OpenClaw 爆火,则是自己感受到的转折点:从那之后,花钱买 token 开始心疼了。
这种扩散也正在逐渐影响其他市场。内存厂商把产能优先分配给 AI 和服务器产品,个人电脑、手机等消费电子产品跟着涨价。[11]显卡、内存、消费电子,再到每天使用的推理服务,这些价格变化有各自的成因。放在一起看AI 的需求不再只影响训练模型的人,而是在沿着产业链,进入越来越多人的账单。 再往后,如果推理从企业工作流继续扩展到更广泛的个人生活,长期运行的个人助手、日常设备里的智能功能,都可能带来持续的算力消耗。届时,电力会不会成为下一个明显受到供需冲击的要素?
需求可以快速扩散,基础设施却有自己的建设周期。 电力又不同于显卡或消费电子,它是整个社会的基础。模型能力正在外溢到生活的方方面面。一方面,越来越多的人主动把工作和日常事务交给它;另一方面,它所牵动的硬件、能源和基础设施,也会影响从未使用过模型的人。无论主动还是被动,我们都身处漩涡之中。在 token 真正成为稳定、可预期的基础服务之前,还有许多风暴即将到来。
据央视新闻,“十五五”时期,我国将把握新一代通信网络建设的战略机遇,适度超前、系统推进新一代通信网建设。
工业和信息化部副部长余晓晖表示,要坚持应用牵引、适度超前、系统推进新一代通信网建设,推进宽带网络向双万兆演进,推进低轨卫星互联网系统建设,统筹优化国际海陆网络布局,推动算力设施扩容提质,强化算网协同和算力互联,更好支撑一体化算力网建设。[12]
https://github.com/knapcio/GLM-5.3-Flash-4x-DGX-Spark-TP4 ↩︎
https://github.com/dzhsurf/deepseek-v3-r1-deploy-and-benchmarks ↩︎
https://forums.developer.nvidia.com/t/2-23-2026-price-change-announcement/361713 ↩︎
https://web.archive.org/web/20260111140934/https://api-docs.deepseek.com/zh-cn/quick_start/pricing ↩︎
https://api-docs.deepseek.com/zh-cn/img/v4.1_260910_price_cn.jpeg ↩︎
https://www.trendforce.com/presscenter/news/20260331-12995.html ↩︎

浙公网安备 33010602011771号