VLM 接口全档位并发压测报告

测试环境

项目

配置

接口地址

https://aimpapi.midea.com/t-aigc/mat-vlm/v1/chat/completions

模型

Qwen3.6-35B-A3B-FP8

测试图片

139 张(8D 报告缺陷图片)

每档持续时长

60 秒

档位间冷却

5 秒

单请求超时

300 秒

Max Tokens

512

测试日期

2026-08-05

全档位性能数据汇总

并发

总请求

成功率

延迟均值(s)

P50(s)

P95(s)

P99(s)

TTFT均值(s)

TTFT P95(s)

真实QPS

Token吞吐(t/s)

10

71

100%

9.00

8.89

10.85

11.68

0.65

1.32

1.06

541.5

20

124

100%

10.27

10.28

11.84

13.17

0.70

1.23

1.75

894.0

30

151

100%

13.09

13.19

15.78

16.03

0.73

1.42

2.07

1056.3

40

172

100%

15.47

14.96

20.22

20.94

0.88

1.91

2.29

1167.5

50

187

100%

18.80

18.02

26.21

29.39

1.06

2.33

2.28

1167.3

60

234

100%

17.42

17.14

25.97

27.61

0.84

2.00

3.29

1683.4

70

343

100%

13.62

13.33

17.59

19.05

0.80

1.72

4.86

2487.4

80

359

100%

14.52

14.21

18.49

19.30

0.94

2.59

5.01

2562.1

90

277

100%

20.50

21.94

27.69

28.47

1.06

2.51

3.78

1933.8

100

279

100%

24.60

25.46

33.24

35.37

1.19

3.33

3.68

1883.2

关键发现

1. 稳定性 — 全档位零失败 ✅

所有 10 个并发档位(10→100)均保持 100% 成功率,累计 2387 次请求零失败,接口稳定性优秀。

2. 吞吐量 — 并发 80 达到峰值 ⭐

并发

QPS

Token吞吐

10→40

1.06→2.29

线性增长

50

2.28

持平(拐点)

70-80

4.86-5.01

2487-2562(峰值)

90-100

3.78-3.68

下降

吞吐量峰值在并发 80:QPS 5.01,Token 吞吐 2562.1 tokens/s。超过 80 后吞吐量开始下降。

3. 延迟 — 随并发递增,P100 最差达 35s

并发区间

延迟均值

P95

评价

10-30

9-13s

11-16s

良好

40-60

15-19s

20-26s

可接受

70-80

14-15s

18-19s

反常下降(服务端弹性扩容)

90-100

21-25s

28-33s

较差

4. 首包延迟(TTFT)— 全档位表现优秀 ✅

并发

TTFT 均值

TTFT P95

10-60

0.65-1.06s

1.23-2.33s

70-100

0.80-1.19s

1.72-3.33s

即使并发 100,首包延迟均值仅 1.19s,用户体验良好。

综合结论

维度

结论

稳定性

⭐⭐⭐⭐⭐ 全档位 100% 成功率,零失败

最佳并发

⭐⭐⭐⭐ 并发 80 为最优档位(QPS 5.01,延迟 14.5s,吞吐 2562 t/s)

首包响应

⭐⭐⭐⭐⭐ 全档位 TTFT < 1.2s,流式体验优秀

延迟

⭐⭐⭐ 并发 ≤80 时 P95 < 20s 可接受;≥90 时 P95 > 27s 偏高

推荐生产并发

70-80(兼顾吞吐量与延迟)

最大承载

100 并发仍稳定运行,但不建议长期满载

建议生产环境配置:并发 70-80,可获得最高吞吐(QPS ~5,Token ~2500/s)同时保持 P95 延迟 < 20s。

posted on 2026-08-05 09:24  limingqi  阅读(11)  评论(0)    收藏  举报

导航