VLM 四模型对比评估报告
一、测试方案
|
项目 |
说明 |
|
测试样本 |
8 张来自 4 份 8D 整改报告的相同问题描述图片(四模型使用完全相同的数据集) |
|
评测维度 |
增强价值评分(1-10)、解析成功率、响应耗时、缺陷识别能力 |
|
测试时间 |
2026-07-29 |
二、对比模型
|
模型ID |
模型名称 |
API端点 |
特点 |
|
qwen25_32b |
Qwen2.5-VL-32B-Instruct |
FP16 原版 |
|
|
qwen25_32b_awq |
Qwen2.5-VL-32B-Instruct-AWQ |
AWQ 量化(推荐) |
|
|
qwen36_35b |
Qwen3.6-35B-A3B-FP8 |
FP8 |
|
|
qwen36_27b |
Qwen3.6-27B-FP8 |
FP8 |
三、核心指标对比(相同8张图片)
|
指标 |
32B 原版 |
32B AWQ |
35B FP8 |
27B FP8 |
|
解析成功率 |
100.0% |
100.0% |
100.0% |
100.0% |
|
平均增强价值评分 |
7.0/10 |
7.0/10 |
7.4/10 |
7.9/10 |
|
平均响应耗时 |
10.5s |
7.9s ⚡ |
171.3s |
207.6s |
|
总耗时 |
83.7s |
63.2s ⚡ |
1370.3s |
1660.7s |
|
相对 32B 加速 |
1.00x |
1.33x |
0.06x |
0.05x |
|
相对 35B 加速 |
16.3x |
21.7x |
1.00x |
0.82x |
|
高价值样本(8-10分) |
0 |
0 |
3 |
7 |
|
中等价值样本(5-7分) |
8 |
8 |
5 |
1 |
四、速度对比可视化
响应速度(越短越快):
32B AWQ: ██████ 7.9s/张 ⚡ 最快
32B 原版: ████████ 10.5s/张
35B FP8: ████████████████████████████████████████████████████ 171.3s/张
27B FP8: ██████████████████████████████████████████████████████████████ 207.6s/张
质量评分(越高越好):
27B FP8: ████████████████████ 7.9/10
35B FP8: ██████████████████ 7.4/10
32B 原版: ████████████████ 7.0/10
32B AWQ: ████████████████ 7.0/10
五、逐图片耗时对比
|
# |
图片 |
32B 原版 |
32B AWQ |
35B FP8 |
27B FP8 |
|
1 |
重量不合格报告 |
19.0s |
12.4s |
231.3s |
253.8s |
|
2 |
雪花灯箱片_img2 |
9.7s |
7.2s |
178.1s |
196.2s |
|
3 |
雪花灯箱片_img3 |
8.8s |
7.2s |
179.8s |
198.7s |
|
4 |
雪花灯箱片_img4 |
8.7s |
7.1s |
138.4s |
200.1s |
|
5 |
雪花灯箱片_img5 |
9.9s |
7.5s |
180.6s |
197.6s |
|
6 |
雪花灯箱片_img6 |
8.9s |
7.5s |
175.4s |
200.0s |
|
7 |
灯箱片_img2 (188) |
10.0s |
7.0s |
108.2s |
199.3s |
|
8 |
灯箱片_img3 (188) |
8.7s |
7.3s |
178.5s |
198.7s |
|
合计 |
83.7s |
63.2s ⚡ |
1370.3s |
1660.7s |
六、结论与建议
核心结论
|
维度 |
最优模型 |
说明 |
|
响应速度 |
⭐ 32B AWQ |
7.9s/张,比原版快 24%,比 35B/27B 快 21-26 倍 |
|
解析质量 |
27B FP8 |
平均 7.9/10,90% 为高价值样本 |
|
质量与速度平衡 |
⭐ 32B AWQ |
质量与原版 32B 相同(7.0/10),但速度更快 |
|
实时/低延迟 |
⭐ 32B AWQ |
低延迟、稳定、无需认证 |
AWQ 量化版本的优势
- 速度提升 24%:7.9s vs 10.5s,每张图片节省 2.6 秒
- 质量完全一致:相同的 7.0/10 评分,缺陷识别结果相同
- 无需认证:API 不需要 Bearer Token,部署更简单
- 更稳定:100% 成功率,无超时或错误
推荐使用场景
|
场景 |
推荐模型 |
理由 |
|
实时/交互式应用 |
⭐ 32B AWQ |
响应最快(7.9s),质量可接受 |
|
批量处理(不限时) |
27B FP8 |
质量最优(7.9/10) |
|
质量与速度平衡 |
⭐ 32B AWQ |
综合表现最佳 |
|
需要高质量描述 |
27B FP8 |
增强描述最详细 |
成本估算(处理 1000 张图片)
|
模型 |
预计耗时 |
|
32B AWQ |
~2.2 小时 ⚡ |
|
32B 原版 |
~2.9 小时 |
|
35B FP8 |
~38 小时 |
|
27B FP8 |
~46 小时 |
局限性说明
- 本次测试仅使用 8 张图片,样本量较小
- 建议扩展到 50 张图片进行更全面的评估
- AWQ 量化可能在某些复杂场景下有精度损失
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22037421
浙公网安备 33010602011771号