摘要: 一台 4×RTX 4090 上的 vLLM + Qwen3.8-27B-AWQ,从首 token 延迟到大海捞针,一次聊透。 局域网里新起了一台推理服务器。与其看跑分,不如直接按在地上测一遍:性能压到 128 路并发、智商做一套带陷阱的题、256K 上下文真塞满试试。以下是一个下午的完整"体检报告" 阅读全文
posted @ 2026-08-17 08:18 AiFly 阅读(498) 评论(0) 推荐(0)