摘要:
使用 wrk2 压测 TensorRT-LLM (trtllm-serve) 实战记录 一、测试背景与目标 在完成 TensorRT-LLM 部署后,本次使用 wrk2 对 trtllm-serve 服务进行恒定速率压测。wrk2 是 wrk 的改进版,支持通过 -R 参数指定恒定请求速率,并修正了 阅读全文
posted @ 2026-09-22 10:00
xzy186
阅读(3)
评论(0)
推荐(0)
摘要:
TensorRT-LLM 部署与性能压测实战记录(Qwen2.5-7B-Instruct) 一、测试背景与目标 在完成 vLLM 框架的性能压测后,本次转向 NVIDIA 官方推理框架 TensorRT-LLM,在 ModelScope 免费实例(A10 22GB 显存)上部署 Qwen2.5-7B 阅读全文
posted @ 2026-09-22 10:00
xzy186
阅读(3)
评论(0)
推荐(0)
摘要:
使用 Vegeta 对 vLLM 大模型进行性能压测实战记录 一、测试背景与目标 在之前使用 vllm bench serve 和 Locust 压测的基础上,本次引入 Vegeta 这一轻量级 HTTP 压测工具,针对 vLLM 部署的 Qwen2.5-7B-Instruct 模型进行性能测试。 阅读全文
posted @ 2026-09-22 09:57
xzy186
阅读(4)
评论(0)
推荐(0)
摘要:
vLLM Bench Serve 压测实战记录(Qwen2.5-7B-Instruct) 一、测试背景与目标 本次测试基于 ModelScope 免费 GPU 实例,使用 vLLM 部署 Qwen2.5-7B-Instruct 模型,利用 vllm bench serve 工具,通过控制请求速率(R 阅读全文
posted @ 2026-09-22 09:55
xzy186
阅读(5)
评论(0)
推荐(0)
浙公网安备 33010602011771号