AWQ 32B vs 原版 32B 对比评估报告

一、测试方案

项目

说明

测试样本

50 张来自 15 份 8D 整改报告的相同问题描述图片

对比模型

Qwen2.5-VL-32B-Instruct (原版) vs Qwen2.5-VL-32B-Instruct-AWQ (量化版)

评测维度

解析成功率、增强价值评分、响应耗时、缺陷识别能力

测试时间

原版: 2026-07-28,AWQ: 2026-07-29

二、核心指标对比

指标

AWQ 32B (量化版)

原版 32B (FP16)

变化

解析成功率

100.0%

74.0%

+26.0%

成功/总数

50/50

37/50

+13

平均增强价值评分

6.00/10

5.81/10

+0.19

平均响应耗时

7.7s

~17s

快 2.2x

总耗时

387s

~850s

快 2.2x

最小耗时

4.9s

-

-

最大耗时

12.5s

-

-

中位数耗时

7.4s

-

-

三、评分分布对比

评分区间

AWQ 32B

原版 32B

高价值 (8-10分)

0 (0.0%)

15 (40.5%)

中等价值 (5-7分)

40 (80.0%)

12 (32.4%)

低价值 (1-4分)

10 (20.0%)

10 (27.0%)

📝 说明: AWQ 32B 的评分更保守,倾向于给出中等评分(5-7分),而原版 32B 的评分分布更分散。但两者的平均评分接近(6.00 vs 5.81)。

四、缺陷类型识别对比

AWQ 32B 缺陷类型分布(共 50 条)

缺陷类型

数量

占比

其他

16

32%

尺寸偏差

15

30%

外观不良

12

24%

色差

6

12%

裂纹

1

2%

原版 32B 缺陷类型分布(共 37 条)

缺陷类型

数量

占比

外观不良

10

27%

尺寸偏差

8

22%

色差

6

16%

缺陷识别能力对比

能力

AWQ 32B

原版 32B

识别的缺陷类型数

5 种

3 种

尺寸偏差识别

✅ 15 条

8 条

外观不良识别

✅ 12 条

10 条

色差识别

✅ 6 条

6 条

裂纹识别

✅ 1 条(新增)

❌ 未识别

✅ AWQ 32B 能识别出更多的缺陷类型,包括原版未能识别的"裂纹"类型。

五、各报告耗时统计

报告名

图片数

平均耗时

湿度传感器发白的8D改善报告

5

5.4s

新乡东阳贮液罐送错货报告

3

5.6s

雪花灯箱片8D整改报告

5

7.3s

12133100005188雪花灯箱片报告

5

7.3s

12122000037505电控安装盒盖报告

2

7.3s

关于12366隔板翻边高度报告 - 副本

5

7.6s

新乡东阳贮液罐报告 -2

3

5.9s

湿度传感器发白飞边报告

5

6.6s

关于12366隔板翻边高度报告

5

8.1s

27284旋钮色差报告 - 副本

3

10.0s

27284旋钮色差报告

3

9.9s

12400301000026隔音棉报告

2

10.7s

12122000036329电控盒报告

2

12.2s

12122000038006电控安装盒盖报告

1

12.5s

16020600A31669分析报告

1

7.9s

六、速度对比可视化

响应速度(越短越快):

AWQ 32B:   ██████ 7.7s/张  ⚡ 最快
原版 32B:  ██████████ 17s/张

速度提升: 2.2x (快 118%)

七、综合结论

7.1 关键发现

维度

结论

可靠性

AWQ 32B 更可靠:100% 成功率 vs 74%,26% 的提升

响应速度

AWQ 32B 更快:7.7s vs 17s,快 2.2 倍

解析质量

两者相当:平均评分 6.00 vs 5.81,差异不大

缺陷识别

AWQ 32B 更好:能识别 5 种缺陷类型 vs 3 种

稳定性

AWQ 32B 更稳定:所有图片均成功,无超时或错误

7.2 AWQ 32B 的优势

  1. 26% 更高的成功率:50/50 全部成功,原版有 13 张因 0 字节空文件等原因失败
  2. 2.2 倍更快的速度:平均 7.7s/张,处理 50 张节省约 463 秒
  3. 更丰富的缺陷识别:多识别出"裂纹"缺陷类型
  4. 更稳定的表现:无超时、无错误、无失败

7.3 评分差异说明

AWQ 32B 的评分分布(0% 高价值 vs 40.5% 高价值)可能由以下原因造成:

  • 量化模型的评分标准差异:AWQ 量化模型倾向于给出保守的中等评分
  • Prompt 理解差异:两个模型对评分标准的理解可能略有不同
  • 但平均评分接近:6.00 vs 5.81,说明整体质量相当

7.4 成本估算对比

场景

AWQ 32B

原版 32B

节省

处理 50 张图片

387s (~6.5分钟)

850s (~14分钟)

463s (~7.7分钟)

处理 500 张图片

~65分钟

~142分钟

~77分钟

处理 1000 张图片

~2.2小时

~4.7小时

~2.5小时

7.5 最终建议

场景

推荐模型

理由

生产部署

AWQ 32B

更可靠、更快、更稳定

实时/交互式

AWQ 32B

低延迟带来更好的用户体验

批量处理

AWQ 32B

节省近一半的处理时间

需要高分样本

可考虑原版

评分分布更分散,但平均质量相当

八、生成的文件

  • [awq_vs_original_comparison.json](file:///Users/midea/matcontrol/report_awq_vs_original/awq_vs_original_comparison.json) - 详细对比数据
  • [results_qwen25_32b_awq.json](file:///Users/midea/matcontrol/report_awq_vs_original/results_qwen25_32b_awq.json) - AWQ 32B 详细结果
  • [vlm_evaluation_report.json](file:///Users/midea/matcontrol/report/vlm_evaluation_report.json) - 原版 32B 结果(已有)

九、局限性说明

  • 两个模型使用相同的 Prompt 和参数配置,但量化版本可能存在微小的行为差异
  • 评分标准的差异需要进一步研究
  • 建议在更多场景下进行测试,包括:
    • 不同类型的图片(实体缺陷、系统截图、文档照片等)
    • 更大规模的数据集
    • 主观评估实际使用价值

posted on 2026-07-29 14:32  limingqi  阅读(8)  评论(0)    收藏  举报

导航