杭州AdventureX 黑客松
Day -INF
在无锡旅游中......
Day 0(7.22)
先去展厅上逛了一圈,拿了非常多的周边!!然后中午这样去签到,拿到了选手牌子



Day1(7.23)
硬件从0到1哈,我们富裕了!
谁懂凌晨我们还什么都没有,一下午我们直接拥有了至高无上的硬件设备!
我还遇到了最喜欢的偶像————郑林楷!


Day2(7.24)
上午起晚了,中午就去看队友写的ROS文档,但是吧,这文档有一点问题,有些包的一些依赖没有,并且运行终端直接跳,完美没给我思考错误的时间。我直接用codex魔改!魔改完有惊无险能运行!机械臂跑起来啦!!

调试完我就直接去搞RDK X5了,在这里我分清了什么叫做 NPU(神经网络处理器)、BPU(中央处理器(CPU)内部专门用于处理程序分支指令的关键功能模块)(还有一种解释是Brain Processing Unit,大脑处理器,嵌入式人工智能处理器架构)
于是我直接用新买来的 HDMI线 连接显示器 和 RDK X5,但是我发现我的HDMI线似乎有故障,只能选择C to C连接PC,PC上开 VNC 开 ubuntu22.04 依旧换源、上魔法、传文件(FTP)三件套,上魔法是ARM的,我之前给他上了个X86_64,难怪用不了,指令集都不一样!
过了很长一段时间,能用codex转 gpt5.5了,开发效率在一路升高!
晚上听了点脱口秀,好玩好欢乐!
后面听完继续工作,了解了一波VLA和ROS2一些其他东西
VLA 也就是 Vision-Language-Action模型,适合更复杂、更开放的任务(同时理解图像、语言和动作)
TF坐标 就是不同设备/部件的坐标系之间是什么空间关系
Base_link 就是机械臂基座坐标系,就比如说我是相机 手现在在我前方0.6米,偏右0.1米,偏下0.05米,但机械臂要的是 这个手相对于机械臂的 Base_link 是 x = 0.42,y = -0.88,z = 0.30(这个转换关系就是TF)
VLM 也就是 Vision-Language Model (视觉语言模型)可以同时理解图像和文本信息,实现跨模态的推理和理解
ONNX是一种通用模型交换格式,.pt是Pytorch自己保存的模型格式
端到端学习是模型直接从原始输入学习到最终输出,中间少量人工拆分和干预,比如机械臂控制方案——摄像头图像+机械臂状态->一个模型->机械臂下一步动作
什么时候上VLA?
1.需要抓取、摆放、整理一系列复杂的操作的时候采用
2.场景变化很多,不能靠固定规则写死
如果是我们这个识别到手,机械臂就向前与我们握手的话,其实完全可以先不需要用VLA,可以先视觉模型识别人手,输出手的2D/3D位置,然后轨迹参数固定即可。
你可能会产生一个疑问,那会不会机械臂并不能很精准去握到手呢?
没错确实不能很精准去握手,为了优化这个过程,可以加两次视觉,第一次靠近客人靠近前连续检测几帧,确认手的位置稳定后微调一下机械臂本身的位置再去握手
Day3(7.24)
本文来自博客园,作者:Alaso_shuang,转载请注明原文链接:https://www.cnblogs.com/Alaso687/p/21897514

浙公网安备 33010602011771号