转:对话前华为智驾AI一号位黄青虬:数据质量第一,模型架构第二
对话前华为智驾AI一号位黄青虬:数据质量第一,模型架构第二 【https://mp.weixin.qq.com/s/SGJ6V-nqjP62fKgHFvWI1A?color_scheme=dark】
摘录:
假设数据质量无限高,再简单的模型也能训出很好的结果
数据质量第一,模型架构第二
而要解决智能化的问题,黄青虬将数据工程视为破局的关键。在黄青虬看来,“模型架构其实是越简单越好”,“假设数据质量无限高,再简单的模型,也能训出很好的结果”。
模型的本质,其实是做信息的压缩、模态的转换,模型的能力上限,取决于参数量。大家对模型架构所做的改进,其作用更多的是在提高模型吸收数据的效率,对模型的能力上限影响相对低。而效率是能够用更多的数据、更长的训练时间弥补的。
在数据采集环节,墨奇智能自研了轻便的穿戴式设备,在酒店或者商住公寓等各种商用场景,雇了许多保洁员进行数采。“采回来之后,就需要做严格的数据质量筛选。因为可能有些数据存在动作不准确、佩戴不规范等各种各样的情况,你需要把里面有效的数据筛出来。” “筛出来之后还要给它们做归类,保证我的数据虽然是海量的,但最终训练每一个模型要用哪些数据,我能精准地检索出来。” 归类之后,企业还对数据进行自动标注,打上训练需要的真值,最后用来训练模型。同时墨奇智能设计了多道防线,对模型做规模化的评测,“评测完后那些觉得不太好的场景,我们又重新回去采集、挖掘。”
而在数据闭环系统里,“有成千上万这样的细节,每个细节都要做到极致,每个细节都有可能导致各家拉开差距”。黄青虬对数据工程的深刻理解,正是得益于自动驾驶经历的赋能。在他的技术路线里,数据闭环是底层根基,自研原生具身模型,则是将数据价值最大化的必然一步。
在模型技术路线的选择上,黄青虬不希望给墨奇智能的模型,贴上世界模型或VLA的标签。他认为更应该关注的是两点,第一是输入什么、输出什么,第二是是否遵循端到端的训练范式。只要把这两大基础打牢,训练模型的手段可以随时换,无论VLA还是世界模型,“本质上只是阶段性的工具和插件”。
黄青虬的理念是,未来墨奇智能一定要做自己的预训练,做一个原生的具身模型。
但在抵达这个阶段之前,墨奇智能会先通过后训练,快速积累真机经验和系统能力,“这个阶段已经过去了”。目前,墨奇智能正基于开源模型去做预训练,大约在今年底,墨奇智能已积累足够数据时,便会从零开始训练自己的原生模型。

浙公网安备 33010602011771号