讲个token plan的“少即是多”笑话

虽然很多模型都支持512K甚至1M的上下文,但是大部分人的日常使用一轮会话(多次请求)加起来都不到256K。

因此主动将上下文长度设置为256K反而能省Token。

因为大部分情况下你都会忘记主动触发compact,而两轮会话之间的时间间隔会超过服务商的缓存存活时间。

也就是当你的上下文是700K/1M的时候,你接下来的会话可能只需要使用50K,但是抱歉,因为你过了缓存存活时间,所以先付700K的输入费用。

不得不说,这又是一次“少即是多”思想的胜利。

posted @ 2026-09-17 12:04  凉快李某  阅读(4)  评论(0)    收藏  举报