摘要:
我们知道LLM的调用不仅仅是一个耗时的操作,还会产生一定的费用,所以我们希望能够尽可能地减少不必要的调用。`CachingChatClient`就是为此而生的一个中间件实现,它通过在内存中维护一个缓存来存储之前调用LLM的输入和输出,从而避免了对相同输入的重复调用。当我们调用`GetResponseAsync`方法时,`CachingChatClient`会先检查缓存中是否已经存在针对相同输入的响应,如果存在就直接返回缓存中的响应,而不需要再次调用LLM;如果不存在,那么它就会调用LLM来获取响应,并将输入和响应一起存储到缓存中,以便下次使用 阅读全文
posted @ 2026-06-05 08:38
Artech
阅读(238)
评论(0)
推荐(4)


浙公网安备 33010602011771号