1.3 基于AI比较yoloV26和yoloV11在同一数据集上训练效果
近日在modelscop中看到了yoloV26的相关消息,作为一名图像处理工程师,我在过往对yolo系列
的还是非常情有独钟的,这里对同样的数据集做同样的实验,验证模型能力。
首先需要提一句的是,之前和这里的实验都是基于Kaggle免费的资源实现的,这么多年过去了,之前在kaggle上的数据都在,而且发现Kaggle在保持30H/每周 免费GPU的基础上,还添加了AI的功能,这些后续会继续研究。
最终的结果保存在:https://github.com/jsxyhelu/YoloV26_VS_YoloV11
一、数据背景
采用开源的飞机数据集"mar20":
这个数据集不仅提供了正框(HBB)而且提供了倾斜框(OBB)的标注结果,方便同步开展实验:
二、正框实验
1.yolov11_mar20_hbb (正框 HBB)
https://www.kaggle.com/code/jsxyhelu2019/yolov11-mar20/notebook
主要结论:
2.yolov26-mar20
这里尝试,基于trae+GLM4.7直接生成结果。
这里我指明了需要参考的对象,并且生成了思维步骤。这里应该是得益于yolo系列在命令操作上的统一性,所以没有遇到太大的问题。生成的结果同样上传
https://www.kaggle.com/code/jsxyhelu2019/yolov26-mar20
大模型预估的结果:
实际的结果:
【这里从数据结果上,并没有增量】
三、倾斜框实验
为什么我要区分两个实验了,是因为
1.yolov11_mar20_obb (倾斜框)
https://www.kaggle.com/code/jsxyhelu2019/yolov11-mar20-obb
2.yolov26_mar20_obb
采用的方法就是直接评估后形成skill,然后直接复制思路。
https://www.kaggle.com/code/jsxyhelu2019/yolov26-mar20-obb
大模型给的判断是:
实际生成结果:
四、初步小结
从实验数据上没有表明,
②首先给我的启发,就是如果可以基于OpenClaw把这个过程自动化,那么是否可以提高解决Kaggle题目的效率?因为很多时候,解题的思路都可以从别人那里学到,而且对于Kaggle的这样比赛而言,它是有边界的;
③其次给我联想的,就是GLM4.7这样的大规模模型在解决前面的一些问题中效果很好,但是如果我只有上一个阶段的模型,那么是否仍然可以复用一些思路想法;
yolo仍然在持续的发展。那么在这个AI技术发展非常迅速的今天,是否会带来新的变化?
无论何时,算力、能够拿到手里的算力都是开展下一步创造的基础,而这需要长期规划准备,这一点毋庸置疑。
浙公网安备 33010602011771号