VLM 四模型对比评估报告

一、测试方案

项目

说明

测试样本

8 张来自 4 份 8D 整改报告的相同问题描述图片(四模型使用完全相同的数据集)

评测维度

增强价值评分(1-10)、解析成功率、响应耗时、缺陷识别能力

测试时间

2026-07-29

二、对比模型

模型ID

模型名称

API端点

特点

qwen25_32b

Qwen2.5-VL-32B-Instruct

aimpapi.midea.com/t-aigc/aimp-qwen2-5-vl-32b-instruct

FP16 原版

qwen25_32b_awq

Qwen2.5-VL-32B-Instruct-AWQ

aimpapi.midea.com/t-aigc/test-qwen32b-awq-test-kval

AWQ 量化(推荐)

qwen36_35b

Qwen3.6-35B-A3B-FP8

aimpapi.midea.com/t-aigc/test-qwen35b-vl-testwljc8dbg-1jd2

FP8

qwen36_27b

Qwen3.6-27B-FP8

aimpapi.midea.com/t-aigc/test-qwen27b-vlwljc8dbg-72mn

FP8

三、核心指标对比(相同8张图片)

指标

32B 原版

32B AWQ

35B FP8

27B FP8

解析成功率

100.0%

100.0%

100.0%

100.0%

平均增强价值评分

7.0/10

7.0/10

7.4/10

7.9/10

平均响应耗时

10.5s

7.9s

171.3s

207.6s

总耗时

83.7s

63.2s

1370.3s

1660.7s

相对 32B 加速

1.00x

1.33x

0.06x

0.05x

相对 35B 加速

16.3x

21.7x

1.00x

0.82x

高价值样本(8-10分)

0

0

3

7

中等价值样本(5-7分)

8

8

5

1

四、速度对比可视化

响应速度(越短越快):

32B AWQ:  ██████ 7.9s/张  ⚡ 最快
32B 原版: ████████ 10.5s/张
35B FP8:  ████████████████████████████████████████████████████ 171.3s/张
27B FP8:  ██████████████████████████████████████████████████████████████ 207.6s/张
质量评分(越高越好):

27B FP8:  ████████████████████ 7.9/10
35B FP8:  ██████████████████ 7.4/10
32B 原版: ████████████████ 7.0/10
32B AWQ:  ████████████████ 7.0/10

五、逐图片耗时对比

#

图片

32B 原版

32B AWQ

35B FP8

27B FP8

1

重量不合格报告

19.0s

12.4s

231.3s

253.8s

2

雪花灯箱片_img2

9.7s

7.2s

178.1s

196.2s

3

雪花灯箱片_img3

8.8s

7.2s

179.8s

198.7s

4

雪花灯箱片_img4

8.7s

7.1s

138.4s

200.1s

5

雪花灯箱片_img5

9.9s

7.5s

180.6s

197.6s

6

雪花灯箱片_img6

8.9s

7.5s

175.4s

200.0s

7

灯箱片_img2 (188)

10.0s

7.0s

108.2s

199.3s

8

灯箱片_img3 (188)

8.7s

7.3s

178.5s

198.7s

合计

 

83.7s

63.2s

1370.3s

1660.7s

六、结论与建议

核心结论

维度

最优模型

说明

响应速度

32B AWQ

7.9s/张,比原版快 24%,比 35B/27B 快 21-26 倍

解析质量

27B FP8

平均 7.9/10,90% 为高价值样本

质量与速度平衡

32B AWQ

质量与原版 32B 相同(7.0/10),但速度更快

实时/低延迟

32B AWQ

低延迟、稳定、无需认证

AWQ 量化版本的优势

  1. 速度提升 24%:7.9s vs 10.5s,每张图片节省 2.6 秒
  2. 质量完全一致:相同的 7.0/10 评分,缺陷识别结果相同
  3. 无需认证:API 不需要 Bearer Token,部署更简单
  4. 更稳定:100% 成功率,无超时或错误

推荐使用场景

场景

推荐模型

理由

实时/交互式应用

32B AWQ

响应最快(7.9s),质量可接受

批量处理(不限时)

27B FP8

质量最优(7.9/10)

质量与速度平衡

32B AWQ

综合表现最佳

需要高质量描述

27B FP8

增强描述最详细

成本估算(处理 1000 张图片)

模型

预计耗时

32B AWQ

~2.2 小时

32B 原版

~2.9 小时

35B FP8

~38 小时

27B FP8

~46 小时

局限性说明

  • 本次测试仅使用 8 张图片,样本量较小
  • 建议扩展到 50 张图片进行更全面的评估
  • AWQ 量化可能在某些复杂场景下有精度损失

posted on 2026-07-29 14:39  limingqi  阅读(10)  评论(0)    收藏  举报

导航