讲个token plan的“少即是多”笑话
虽然很多模型都支持512K甚至1M的上下文,但是大部分人的日常使用一轮会话(多次请求)加起来都不到256K。
因此主动将上下文长度设置为256K反而能省Token。
因为大部分情况下你都会忘记主动触发compact,而两轮会话之间的时间间隔会超过服务商的缓存存活时间。
也就是当你的上下文是700K/1M的时候,你接下来的会话可能只需要使用50K,但是抱歉,因为你过了缓存存活时间,所以先付700K的输入费用。
不得不说,这又是一次“少即是多”思想的胜利。

浙公网安备 33010602011771号