• 博客园logo
  • 会员
  • 周边
  • 新闻
  • 博问
  • 闪存
  • 赞助商
  • Chat2DB
    • 搜索
      所有博客
    • 搜索
      当前博客
  • 写随笔 我的博客 短消息 简洁模式
    用户头像
    我的博客 我的园子 账号设置 会员中心 简洁模式 ... 退出登录
    注册 登录

河畔那家白粥馆

  • 博客园
  • 联系
  • 订阅
  • 管理

公告

View Post

影视飓风和李飞飞都在聊的世界模型,到底是什么?

如果你对AI行业稍微有一点了解,你就会发现最近一段时间“世界模型”这个词的出现频率变得非常高。哪怕并不了解,你也或多或少刷到过信息。

影视飓风前不久发布了一支视频《在AI里抛硬币,概率是50%吗?》,提到了“世界模型”,李飞飞从去年开始写了2篇长博文专门介绍“世界模型”,各家科技公司也都在忙着发布自己的“世界模型”,那他们说的到底是一回事么? 又有什么区别?

本篇文章不计划堆砌太多技术词汇,讲过于精细的技术细节,这些可能会在后续看具体情况再写吧。本篇类似于科普解释,目的在于让不了解的人员或稍微了解的人员,能对“世界模型”有进一步认识。

这里我借用一个三层思维模型来帮助理清楚,即 why-how-what 黄金圈模型,从内核到外层逐步扩展。

图片

最内部的是 why,为什么要有“世界模型”这个东西?

这个根是在实现通用人工智能AGI上。回顾这几年的大模型发展史,我们能看到依靠纯语言文字发展出了大语言模型LLM,依靠纯图片和视频发展出了视觉大模型LVM,接着是融合了这两者的视觉语言大模型VLM。

从大语言模型到视觉大模型再到视觉语言大模型,我们能感觉到模型的输入在变多,也就是所谓的多模态,它的智能是在往前推进的,那么仅靠这3个能推进到通用人工智能么?

还是不行的。好,说法严谨一点,还是有争议的。因为这三者实际更多学习到的还是相关性表达,也就是预测的下一个token和上一个的关系,是“当出现上文中是A时,此时出现B,下一步更高概率出现C”,学习到的更多是相关性,而非真正的因果逻辑。就像一个人看了八百集《名侦探柯南》,以为能破案,结果只会判断‘穿黑衣服的大概率是凶手’,还是不懂推理逻辑。什么?你说柯南已经1200多集了?!

影视剧风视频中提到的在AI大模型中抛硬币,正面概率高于反面,就是受到了数据偏见的影响,学习到的是抛硬币在历史所有视频中的相关性。

另外,这3者依旧还是“被动的观察者”,就像被固定在那里学习到了知识内容,却从来没有对这个世界做出行动来探索,就像是缸中大脑看文字和视频,学到的是状态,预测的还是状态。

所以你会感觉到,应该还需要加进来什么东西,从被动响应到主动探索。

进而,你会试图构建一个模型,输入的是当前的环境状态加上它想要尝试执行的动作,预测输出的是下一个状态,从而让它学会“如果我对环境做了这个步骤,预计下一步会发生什么呢”。从而,在给定环境上施加动作并预测下一个状态,就不止是旁观,也就有了规划、模拟、推理行动后果的能力。

那么,恭喜你,你发明了“世界模型World Model”。

让AI看明白世界,需要更多的数据,让AI理解世界,需要让它亲手搞砸一次。

所以回到起初问题,问什么要有“世界模型”?因为它是实现通用人工智能AGI的关键路径,当然并不一定是唯一路径,但有了它能更进一步提升模型的能力。这些技术都会是重要组成部分。

但这个概念并非是现在才有的,那为什么偏偏在近两年才爆发?

因为这是一个多方面条件共同促成的结果。

首先技术铺垫已经到位了,大语言模型、视觉大模型这些已经证明了“算力、算法、数据”结合下能推出较强的能力,并提供了算力基础、模型能力等基础建设;另外,这些已有大模型也已经发展到了相对不错的程度,开始边际效益递减,再往下就需要额外的范式突破,"世界模型"这个技术提供了理论可行性;以及狂热的资本也在寻求下一个赛道,在押注接下来爆发的是什么领域,从而资本选中了具身机器人领域,而实现智能化机器人天然需要对空间感知、对未来预测,而这些技术恰好就是世界模型技术能提供的,就这样表现为了资本涌入具身领域,各家都在推自己的世界模型。

世界模型就这样在一个恰当的时间重新出现,站在了前面模型的肩膀上,得到了所需的技术、资本等各个条件,从而吸引了巨量关注。

那么,既然目标清晰、时机已到,就来到了“How”这个问题,即,实现“世界模型”有哪些路径,该如何构造世界模型?

到这里,就得提一个非常有趣的点,就是现有各公司机构提出的“世界模型”其实会有点不一样,这核心是各家对“世界模型”这个词定义的话语权争夺。

“世界模型”这个词本身有广义和狭义的两种理解,前面“why”这个部分说的是狭义的理解,也是资本现在涌入的部分。广义上,“世界模型”就是“对世界运行规律的某种模拟”,所以广义上,大语言模型、视觉大模型也是一种“世界模型”。我在这里将参考李飞飞博文中的分类方式来说明。

下面介绍的3类可以理解为实现世界模型的三种派系,一个单独的世界模型可以仅属于某一个派系,而当前发展趋势是越往后就越走融合路线,最后收敛到趋同。李飞飞认为最终目标是一个单独的模型把3者都能实现。3种分别对应着:

图片

1, 渲染器 Renderer,输出图片或视频,追求视觉上有更好更逼真的效果,模型自身并不理解3D结构或物理规律,只需“看起来对”。

2, 仿真器 Simulator,也翻译为模拟器,关注几何、物理、动力学描述,核心是物理准确性、结构上的精确性。在仿真/模拟这个派别下,重点提2个子类:

2.1, 一类是模型输出可交互、可编辑的结构化3D信息,构建3D世界,比如利用高斯泼溅、碰撞网格构建一个可交互、可编辑的环境世界。构建的这个世界可以用于具身机器人或智驾车辆的训练模拟、游戏开发等各方面。仿真器不仅提供静态背景环境,也包括了“环境对动作的响应”,演算物理后果。

2.2, 另一类是潜空间预测,可以大概理解为潜空间相比于直接输出像素的像素空间更具有抽象层次,就像是用“概念”思考,而非用“画面的像素”思考,从而让模型预测更本质的内容(潜空间的抽象表征)而非预测表象(像素)。 像素空间思考就像是逐帧画手稿,而潜空间思考就像是‘脑补’,我们想‘一个人在跑步’,脑子里是动态的动作概念,而不是每个像素点的颜色。后者更接近人类的直觉。

3, 规划器 Planner,输出行动,给定观测和目标,决定了下一步的动作,核心是决策的有效性。

可能其他文章里又会有不同的分类方式,关键在于理解这几个虽然都被称为“世界模型”,但实际又是有区别的,并且它们也是功能互补的,举个栗子,仿真器提供了桌面上有纸团,桌下有废纸篓的环境,规划器做出把纸团扫进废纸篓的动作,仿真器模拟出响应这个动作后的纸团运动情况,渲染器则能从任意角度输出观测的画面,从而这3个都是最终想要实现的那个统一的“世界模型”的所需功能点。

最终就来到了 What 这个问题,即当前产出了什么样的具体产品,得到什么样的具体效果?

还是按前面3类来分别介绍下。

1, 渲染器:典型例子是视觉大模型,如Sora、Seedance 2.0属于这一类。Sora的原报告标题就是《作为世界模拟器的视频生成模型》,OpenAI认为Sora是世界模型,领域内大牛 Yann LeCun 则反对这一类,他认为视觉大模型可以生成看起来逼真的视频,但无法达成真正地理解和预测物理世界。

2, 仿真器:

2.1, 模型输出结构化3D信息,例子为腾讯混元世界模型2.0,还有李飞飞团队做出的Marble。这两者都类似于生成式仿真器,生成可交互、可编辑的、工业级可用的3D世界,进行交互时世界仍保持几何和物理的一致性。补充下,这两个例子实际是集成了仿真器和前面提到的渲染器在一起。 同时,在影视飓风的视频中提到的用250台相机拍下后再用4DGS技术来重建场景也属于这一类,在这个环境内可以随意的自主的探索。

2.2, 潜空间预测,代表案例是 Yann LeCun 的 JEPA 系列,他现在也已和谢赛宁一起创业,继续扩充这条路线。

3, 规划器: 这是在李飞飞博文中认为“最前沿但也最不成熟的领域”,当下的视觉-语言-行动VLA模型和World Action Model都是规划器的尝试。也有的世界模型实际可能并非由模型内部统一产出,而是外接了一个模块,如强化学习模块来提供的。

Again, 现在看研究趋势,未来会逐步把这3类合并,形成一个统一的世界模型。

最终总结一下。

如果你看到这里,你就能理解“世界模型”这个词既可以是一个宽泛的概念,又可以是狭义的概念。所以就能理解现在各家都可以说自己做的是“世界模型”,只是解释起来并不一样。有点像大家开餐馆都在卖“宇宙第一面”,但有人卖的是汤面,有人是拌面,有人是炒面。

大语言模型是“语言世界的抽象,或者叫同构”,它用文字构建了一个平行的思维空间;视觉大模型是“视觉表象的同构”,它复刻了光影变化;狭义的世界模型是“物理规律的同构”,它提炼了重力、碰撞、因果关系;所以大家都可以在说自己在做世界模型,是它的一部分,而非这个事情全部自身。

如同你如何向一个不了解上海的人说明上海这个城市?你的切面切到陆家嘴、切到弄堂胡同、切到郊区农田,你看到的就会是不同切面的上海,它们都是真实的上海,而非上海全部自身。

所谓网络模型,就是真实世界在机器里的同构。它切面的维度越多,文字+视觉+物理+动作+因果逻辑等等,它的“同构”就越接近我们所处的这个世界,它就越接近我们想要的“通用人工智能”。

图片

进一步考虑,是否我们所处的真实世界是超过我们感官感知的,因为有一些看起来玄而又玄的当下未能解释清楚,所以是否可以认为,我们的人脑感知到的世界,我们人脑内构建的那个模型,也只是这个“真实世界”的一种抽象,一种同构?

也许,我们每个人脑中的世界,也不过是这个宇宙的一张低分辨率‘世界模型’。

-----

本文完,后续不定期更新各类文章,也可以留言抒发你的想法。欢迎点个赞、点个'在看'或留个评论,最后,感谢你的阅读。

posted on 2026-07-28 23:52  河畔那家白粥馆  阅读(2)  评论(0)    收藏  举报

刷新页面返回顶部
 
博客园  ©  2004-2026
浙公网安备 33010602011771号 浙ICP备2021040463号-3