半年前还在威胁员工「不用 AI 就滚蛋」,现在开始偷偷锁 token 了。AI 省钱神话才讲了几个月,现实就拐了个大弯。
一、从「全员 AI」到「省着点用」
2026 年 6 月,404 Media 拿到了一段埃森哲内部的会议录音。AI 战略负责人 Justice Kwak 在里面说了一段让管理层坐不住的话:
「AI 正在成为成本结构中的可见项。支出变得极其不可预测,CFO、COO、CIO 们都在问同一个问题——这笔钱到底带来了什么价值?」
紧接着行动就来了——埃森哲开始紧急限制员工的 token 配额,因为内部审计发现大量 token 被用在了「把 PDF 转成 PPT」这种基础任务上。
这还不是孤例。TechCrunch 同一天报道了这个趋势,给出一个恰如其分的标题:「Tokenmaxxing 时代结束了。」
想想讽刺在哪——距离埃森哲威胁员工「不积极用 AI 会影响晋升」,只过了不到半年。半年前建 employee leaderboard 卷 AI 使用率的同一批公司,现在在找怎么锁 API 限额。
二、钱到底烧哪了
内部审计的数据如果属实,这组数字值得每个 SaaS CFO 看一眼:
- Token 消耗的 60%-70% 集中在低价值重复任务上:PDF 转格式、邮件润色、会议纪要重写
- 真正产生业务增量的调用(数据分析、客户洞察、代码生成)占比不到 20%
- 剩下的 10%-20% 是乱试——把内部文档丢进 chat 问「总结一下」,这种 GPT-4 刚出的时候玩过的事,花着最新的推理成本
来算笔简单的账。一次 GPT-4o 调用大概 $0.01-$0.03,看上去不值几个钱。但在一个 10 万人的组织里,每人每天多调 50 次,一个月就是 $15M。这是微付费陷阱的放大版——每笔几美分不可见,月底账单七位数才跳闸。
更致命的是:大部分 token 花在了「本不需要 AI 也能干」的事情上。 把 PDF 转成 PPT,3 行 Python 就能搞定,但很多人直接丢给 GPT——不是因为快,是因为不用动脑子。
三、谁埋的雷
这个局面的根源,是企业自己挖的。
2025 年底到 2026 年初,AI 行业喊了一个口号:「All-in AI,全员使用」。 各种企业 AI 平台批量上线,Microsoft Copilot、Salesforce Einstein、内部 LLM 网关,管理层的指令统一——用起来,用量就是 KPI。
这个策略有三个结构性缺陷:
1. 没有分层授权。 高级分析师用 AI 做深度数据建模,前台用模型润色一封邮件——消耗的 token 一样贵。但产出的价值差了两个数量级。好的模型路由策略是让分析师用 GPT-4o 做推理,让行政用 Haiku 做摘要,差 10 倍的成本差距。但在 2025 年的「All-in」热潮里,没人关心这个。
2. 衡量指标错了。 用 API 调用量来衡量 AI 采纳率,等于鼓励低价值高频调用冲量。高管 dashboard 上「AI 使用率 87%,环比 +300%」很好看,财务那边 token 账单也是 +300%。指标本身就在制造浪费。
3. 没有成本意识教育。 没人告诉普通员工——一次 GPT-4o 文档分析和一次 Claude Haiku 摘要在成本上差了 10 倍。一条「能用就用最新最强模型」的默认指令,直接指导了员工的行为选择。开挖掘机捡瓶盖,油钱归公司。
四、战术问题和战略问题
表面上这是「AI 预算失控」——财务问题,上 cap、做配额、分级定价就能治。
但深层的问题是:一个组织用 AI 产出的大多是低价值内容,到底是 AI 没用,还是组织不知道怎么用 AI 有用?
埃森哲的例子尤其讽刺。作为全球最大的咨询公司,它向客户推销 AI 转型方案,结果自家 AI 投入优先产出了「PDF 转 PPT」这种价值。这说明 AI Adoption 的真正瓶颈根本不在于模型能力或 token 价格,而在于组织文化和流程设计。
对比一下那些真正从 AI 拿到 ROI 的团队,做法几乎是反过来的:
- 先定业务目标,再选 AI 工具。「将客户响应时间从 4h 降到 1h」→「所以我们需要一个能理解历史工单并生成回复草稿的 RAG 系统」→「所以用 embedding 模型 + Sonnet 做推理」。而不是「我们买了 Copilot,大家用起来」。
- 按角色分层的模型路由。分析师用 Sonnet,运营用 Haiku,内部工具用微调的小模型。OpenRouter 这类平台天然支持路由策略,但大部分企业的默认配置是全量走最强模型。
- token 预算灵活但透明。超额申请比一刀切配额更合理——前提是你能说清楚「我用这额外 100 万 token 做什么,预期什么 ROI」。这不是管制,这恰好是让员工开始思考「AI 到底值不值」的方式。
五、Tokenmaxxing 终结的连锁反应
这件事已经不是某个公司的内部问题了。有几个行业信号值得注意。
「AI 抛售」扩散。 TechCrunch 报道里提到的 AI selloff 正在冲击芯片制造商——存储芯片和 AI 推理芯片的估值预期正在修正。华尔街的逻辑很清楚:企业客户开始收紧 token 预算,意味着推理需求增速可能放缓,那芯片产能的投资回报就要重新算。Cerebras 财报后股价大跌已经是一个先行信号。
CFO 开始算对比账。 当 AI 进入固定运营成本项,CFO 会问一个尖锐的问题:同样 $100 万,花在 AI API 调用上,还是花在传统软件采购上,哪个 ROI 更高?答案是——传统软件的边际成本几乎是零(买完团队随便用),而 AI 的边际成本是每 token 都要续费。这意味着 AI 要在「每元产出」上比传统软件高出显著倍数,才有商业合理性。 这对很多包装成「提效神器」的 AI 应用来说是个硬约束。
「价值评估」取代「用量竞赛」。 2026 年下半年,企业 AI 采购的标准动作会从「哪个模型更强」变成「哪个场景的 token ROI 为正」。这个转变对基础模型厂商(OpenAI、Anthropic、Google)的盈利模式也会产生传导效应——如果企业端需求结构从「不限量调用」变为「高价值场景调用」,API 价格体系可能需要重新设计。按 token 数量定价对低价值高频任务太贵,对高价值低频任务又太便宜。分层定价和承诺消费折扣可能会成为标配。
六、一个开发者的视角
作为一个每天在写代码时重度用 AI 的人,我对这件事的第一反应很直接:
别让组织 KPI 的蠢,伤到个人效率的实。
如果公司说「为了控制成本,每人每天最多调 100 次 AI」,我大概会觉得很扯——因为日调 500 次的重度用户创造的代码价值,远高于 token 成本。一刀切的上限废掉的是最有生产力的那批人,保护的是一周调 10 次、调了也问不到点子的普通用户。
但如果公司说「代码生成和架构评审用一流模型不限量,但 PDF 转 PPT 请走内部脚本」,那我觉得他们算明白了。
好的制度筛选价值的浓度,差的一刀切把好钢和废料一起倒掉。 现在很多企业卡在中间——「我们该不该限制 AI 使用」。答案不是「限制」或「不限」,而是「限制什么场景」。
AI 成本管理的成熟度,大概有三个阶段:
Phase 1: 不管 → 账单爆炸
Phase 2: 一刀切 → 生产力下降
Phase 3: 场景路由 + 成本透明 → 可持续增效
大部分公司现在处于 Phase 1 到 Phase 2 的过渡期。能走到 Phase 3 的,才会从 Tokenmaxxing 的废墟里拿到真正的回报。
浙公网安备 33010602011771号