AWQ 32B vs 原版 32B 对比评估报告
一、测试方案
|
项目 |
说明 |
|
测试样本 |
50 张来自 15 份 8D 整改报告的相同问题描述图片 |
|
对比模型 |
Qwen2.5-VL-32B-Instruct (原版) vs Qwen2.5-VL-32B-Instruct-AWQ (量化版) |
|
评测维度 |
解析成功率、增强价值评分、响应耗时、缺陷识别能力 |
|
测试时间 |
原版: 2026-07-28,AWQ: 2026-07-29 |
二、核心指标对比
|
指标 |
AWQ 32B (量化版) |
原版 32B (FP16) |
变化 |
|
解析成功率 |
100.0% ✅ |
74.0% |
+26.0% |
|
成功/总数 |
50/50 |
37/50 |
+13 |
|
平均增强价值评分 |
6.00/10 |
5.81/10 |
+0.19 |
|
平均响应耗时 |
7.7s ⚡ |
~17s |
快 2.2x |
|
总耗时 |
387s ⚡ |
~850s |
快 2.2x |
|
最小耗时 |
4.9s |
- |
- |
|
最大耗时 |
12.5s |
- |
- |
|
中位数耗时 |
7.4s |
- |
- |
三、评分分布对比
|
评分区间 |
AWQ 32B |
原版 32B |
|
高价值 (8-10分) |
0 (0.0%) |
15 (40.5%) |
|
中等价值 (5-7分) |
40 (80.0%) |
12 (32.4%) |
|
低价值 (1-4分) |
10 (20.0%) |
10 (27.0%) |
📝 说明: AWQ 32B 的评分更保守,倾向于给出中等评分(5-7分),而原版 32B 的评分分布更分散。但两者的平均评分接近(6.00 vs 5.81)。
四、缺陷类型识别对比
AWQ 32B 缺陷类型分布(共 50 条)
|
缺陷类型 |
数量 |
占比 |
|
其他 |
16 |
32% |
|
尺寸偏差 |
15 |
30% |
|
外观不良 |
12 |
24% |
|
色差 |
6 |
12% |
|
裂纹 |
1 |
2% |
原版 32B 缺陷类型分布(共 37 条)
|
缺陷类型 |
数量 |
占比 |
|
外观不良 |
10 |
27% |
|
尺寸偏差 |
8 |
22% |
|
色差 |
6 |
16% |
缺陷识别能力对比
|
能力 |
AWQ 32B |
原版 32B |
|
识别的缺陷类型数 |
5 种 |
3 种 |
|
尺寸偏差识别 |
✅ 15 条 |
8 条 |
|
外观不良识别 |
✅ 12 条 |
10 条 |
|
色差识别 |
✅ 6 条 |
6 条 |
|
裂纹识别 |
✅ 1 条(新增) |
❌ 未识别 |
✅ AWQ 32B 能识别出更多的缺陷类型,包括原版未能识别的"裂纹"类型。
五、各报告耗时统计
|
报告名 |
图片数 |
平均耗时 |
|
湿度传感器发白的8D改善报告 |
5 |
5.4s ⚡ |
|
新乡东阳贮液罐送错货报告 |
3 |
5.6s ⚡ |
|
雪花灯箱片8D整改报告 |
5 |
7.3s |
|
12133100005188雪花灯箱片报告 |
5 |
7.3s |
|
12122000037505电控安装盒盖报告 |
2 |
7.3s |
|
关于12366隔板翻边高度报告 - 副本 |
5 |
7.6s |
|
新乡东阳贮液罐报告 -2 |
3 |
5.9s |
|
湿度传感器发白飞边报告 |
5 |
6.6s |
|
关于12366隔板翻边高度报告 |
5 |
8.1s |
|
27284旋钮色差报告 - 副本 |
3 |
10.0s |
|
27284旋钮色差报告 |
3 |
9.9s |
|
12400301000026隔音棉报告 |
2 |
10.7s |
|
12122000036329电控盒报告 |
2 |
12.2s |
|
12122000038006电控安装盒盖报告 |
1 |
12.5s |
|
16020600A31669分析报告 |
1 |
7.9s |
六、速度对比可视化
响应速度(越短越快):
AWQ 32B: ██████ 7.7s/张 ⚡ 最快
原版 32B: ██████████ 17s/张
速度提升: 2.2x (快 118%)
七、综合结论
7.1 关键发现
|
维度 |
结论 |
|
可靠性 |
⭐ AWQ 32B 更可靠:100% 成功率 vs 74%,26% 的提升 |
|
响应速度 |
⭐ AWQ 32B 更快:7.7s vs 17s,快 2.2 倍 |
|
解析质量 |
≈ 两者相当:平均评分 6.00 vs 5.81,差异不大 |
|
缺陷识别 |
⭐ AWQ 32B 更好:能识别 5 种缺陷类型 vs 3 种 |
|
稳定性 |
⭐ AWQ 32B 更稳定:所有图片均成功,无超时或错误 |
7.2 AWQ 32B 的优势
- 26% 更高的成功率:50/50 全部成功,原版有 13 张因 0 字节空文件等原因失败
- 2.2 倍更快的速度:平均 7.7s/张,处理 50 张节省约 463 秒
- 更丰富的缺陷识别:多识别出"裂纹"缺陷类型
- 更稳定的表现:无超时、无错误、无失败
7.3 评分差异说明
AWQ 32B 的评分分布(0% 高价值 vs 40.5% 高价值)可能由以下原因造成:
- 量化模型的评分标准差异:AWQ 量化模型倾向于给出保守的中等评分
- Prompt 理解差异:两个模型对评分标准的理解可能略有不同
- 但平均评分接近:6.00 vs 5.81,说明整体质量相当
7.4 成本估算对比
|
场景 |
AWQ 32B |
原版 32B |
节省 |
|
处理 50 张图片 |
387s (~6.5分钟) |
850s (~14分钟) |
463s (~7.7分钟) |
|
处理 500 张图片 |
~65分钟 |
~142分钟 |
~77分钟 |
|
处理 1000 张图片 |
~2.2小时 |
~4.7小时 |
~2.5小时 |
7.5 最终建议
|
场景 |
推荐模型 |
理由 |
|
生产部署 |
⭐ AWQ 32B |
更可靠、更快、更稳定 |
|
实时/交互式 |
⭐ AWQ 32B |
低延迟带来更好的用户体验 |
|
批量处理 |
⭐ AWQ 32B |
节省近一半的处理时间 |
|
需要高分样本 |
可考虑原版 |
评分分布更分散,但平均质量相当 |
八、生成的文件
- [awq_vs_original_comparison.json](file:///Users/midea/matcontrol/report_awq_vs_original/awq_vs_original_comparison.json) - 详细对比数据
- [results_qwen25_32b_awq.json](file:///Users/midea/matcontrol/report_awq_vs_original/results_qwen25_32b_awq.json) - AWQ 32B 详细结果
- [vlm_evaluation_report.json](file:///Users/midea/matcontrol/report/vlm_evaluation_report.json) - 原版 32B 结果(已有)
九、局限性说明
- 两个模型使用相同的 Prompt 和参数配置,但量化版本可能存在微小的行为差异
- 评分标准的差异需要进一步研究
- 建议在更多场景下进行测试,包括:
- 不同类型的图片(实体缺陷、系统截图、文档照片等)
- 更大规模的数据集
- 主观评估实际使用价值
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22037039
浙公网安备 33010602011771号