摘要: 在做 LLM-as-a-Judge 的多并发请求时,我一开始以为自己已经把并发开起来了:调度层允许同一轮内多个比较并发、同一比较内多个模型也并发,请求端看起来也是 asyncio。但实际跑下来很奇怪,单模型明明配置了 16 并发,API 后台看到的 RPM 却只有 8 左右,一轮常常要十分钟以上。 阅读全文
posted @ 2026-05-07 13:30 Cold_Chair 阅读(42) 评论(0) 推荐(0)