作者:李润泽

训练环境就绪后,我们迎来的第二个挑战是处理 VisDrone 数据集。这个数据集包含超过 6000 张复杂的无人机航拍图片,我们的目标是从中提取出“行人”和“车辆”两类关键目标。

数据集清洗与格式转换
VisDrone 原始标注格式与 YOLO 要求的归一化坐标有所不同。我们编写了专门的 Python 转换脚本,将标签映射为:0 (行人) 和 1 (车辆)。在过滤过程中,我们发现部分标注含有重复目标,张钧瑞协助优化了脚本,剔除了脏数据,最终保留了约 6471 张训练图片 和 548 张验证图片。

攻克小目标检测难题
无人机视角下,地面行人往往只有几十个像素大小。为了保留特征,我们尝试使用 1280x1280 的高分辨率进行训练。然而,李润泽发现直接上高分辨率导致显存溢出,训练速度极慢。经过权衡,我们最终将分辨率调整为了 960x960,在精度和速度之间取得了平衡。

阶段性成果
我们成功构建了一个高质量的数据集,每张图片平均包含超过 50 个目标实例。这是模型能够精准识别的关键基础。

posted on 2026-06-19 22:20  浪速白雪姬  阅读(7)  评论(0)    收藏  举报