物理AI新范式:Veeda AI,9000万美金种子轮押注下一代世界模型仿真底座
0. 前言:具身智能的终极瓶颈,从来不是大模型
近两年,大模型在文本、图像、视频领域已经实现规模化落地,语义理解、内容生成能力日趋成熟。但机器人、人形智能体、物理端 Agent的商业化落地,始终卡在同一个核心瓶颈:
真实物理世界的试错成本,无法规模化。
真实世界训练存在三大无解痛点:
- 硬件不可并行:GPU 可以 7×24 小时集群跑迭代,但机器人电池、损耗、寿命、场地都有物理上限,无法像算力一样无限扩容。
- 试错代价极高:碰撞、倾倒、操作失误不仅损坏设备,还存在安全风险,无法进行海量随机场景探索。
- 场景极度稀缺:家庭、工业、户外的长尾场景无穷无尽,真实采集标注成本天价,永远跑不完所有 Case。
为了解决这个问题,行业长期依赖传统物理仿真引擎(典型代表 Nvidia Isaac Sim)。 但传统仿真又陷入另一个困境:场景靠人工搭建、参数靠工程师手调,摩擦、材质、碰撞、光照全部需要人工配置,面对未知、随机、生活化场景,泛化能力基本失效。
在这样的行业背景下,Veeda AI 作为 2026 年新晋明星初创登场: 成立仅数月,拿下9000 万美元种子轮(加拿大历史顶级种子轮融资),由 Khosla Ventures、Radical Ventures 联合领投,核心团队全员来自英伟达空间智能实验室,目标非常明确:
抛弃手工写死物理规则的传统仿真,用数据驱动的世界模型,重构物理 AI 的训练底座。
1. Veeda AI 公司全景:团队、背景与定位
1.1 核心团队(英伟达嫡系班底)
- CEO Sanja Fidler:前英伟达 AI 研究副总裁、英伟达多伦多空间智能实验室负责人,全球顶级计算机视觉、三维感知、物理 AI 领域大牛。
- CTO Zan Gojcic、首席科学家 Huan Ling:原英伟达 OmniDreams 核心主创。
整套创始团队,就是英伟达过去几年世界模型 + 空间智能方向的原班研发主力,属于 “大厂成熟团队独立创业”,而非从零组队。
1.2 公司核心定位(非常关键)
Veeda AI 不做机器人、不做硬件、不做终端产品、不做 Agent 策略。 它的唯一定位:
面向物理 AI、具身智能体的「生成式仿真基础设施」
官方比喻非常精准:为机器人打造虚拟 Matrix。 让智能体在 AI 生成的虚拟物理宇宙中,无限次、零成本、安全试错,完成真实世界永远无法完成的超大规模迭代,最终通过 Sim2Real 迁移落地到真实硬件。
1.3 融资背后的行业共识
9000 万美金超高额度种子轮,代表顶级资本统一判断: 下一阶段 AI 的竞争,不在文本、不在画图,而在「物理世界建模与交互能力」。 世界模型,是物理 AI、人形机器人、通用具身智能的底层操作系统。
2. 彻底分清:Sora / 传统仿真 / Veeda 三种范式的本质区别
很多人会混淆视频生成、物理仿真、世界模型,这里做最底层范式拆解,也是理解 Veeda 价值的核心。
2.1 OpenAI Sora:像素级视频生成,无物理、无状态、无交互
- 输入:Prompt 文本
- 输出:逼真连续视频画面
- 核心缺陷: 只追求视觉逼真,不维护环境物理状态、不识别物体逻辑、不响应动作指令。 画面好看,但物体没有质量、没有惯性、没有碰撞规则,机器人无法在里面做试错训练。 结论:内容创作工具,和物理 AI 训练完全无关。
2.2 传统仿真引擎(Nvidia Isaac Sim / Carla):人工定义物理世界
- 所有物理规则:重力、摩擦、弹性、材质、碰撞包围盒,全部工程师手动配置
- 优点:物理稳定、可控、无幻觉、工业可用
- 致命短板: 无法自动生成未知场景,每一个新环境、新物体、新道具都需要建模、调参、适配,泛化能力极差,规模化成本极高。 结论:工业稳定,但无法支撑通用机器人的长尾场景学习。
2.3 Veeda AI:数据驱动的可交互物理世界模型
- 不靠人工写物理规则,模型从海量真实世界视频、传感器数据、机器人轨迹中,自动学习物理规律、空间逻辑、物体交互关系
- 支持动作条件化推演:机器人不同动作,会直接改变环境后续状态,形成完整闭环交互
- 可无限自动生成全新场景、长尾场景、从未见过的生活化场景
核心差异一句话: 传统仿真 = 工程师手工搭好的固定实验室 Veeda 世界模型 = AI 自主学习生成的、可无限演化的真实物理宇宙
3. Veeda AI 完整技术架构(公开可验证核心模块)
基于创始团队过往顶会论文、官方技术披露、招聘技术栈,整理无公式、工程向、完整架构链路。
3.1 整体训练 & 推演链路
多源真实数据输入 → 因果视频分词器时序压缩 → 潜在动力学编码 → 动作条件化世界模型推演 → 虚拟智能体强化学习训练 → Sim2Real 真实硬件迁移
3.2 三大核心技术模块
模块 1:因果视频分词器
传统视频模型在像素级运算,时序长、冗余高、误差累积严重。 Veeda 通过自研分词器,对时空信息做高效压缩,保留物理因果特征,丢弃无效像素冗余,大幅延长可稳定推演时长,缓解长时序崩坏问题。
模块 2:动作‑条件视频动力学模型(核心差异化)
普通视频模型是 “基于过去画面预测下一帧”。 Veeda 模型是: 基于「历史环境画面 + 机器人当前动作序列」预测未来环境变化
这是能否用于机器人训练的核心分水岭。 只有动作可干预环境,才能形成 “感知 - 决策 - 动作 - 环境反馈” 的完整强化学习闭环。
模块 3:潜在动力学模型 + 伪动作恢复
- 将物理环境编码至隐空间推演,避免像素级噪声累积,提升稳定性
- 针对互联网无标注普通视频,通过伪动作逆向恢复,自动反推机器人可行动作序列
解决行业最大痛点:机器人标注数据太贵、太少,Veeda 可以利用全网海量普通视频做物理学习,极大扩充训练数据集。
3.3 核心架构选型
行业最前沿混合架构: 整流流扩散 Transformer + 块因果自回归架构 兼顾:高真实度生成画质、强时序一致性、物理因果稳定性,是目前世界模型领域最优架构组合之一。
3.4 混合仿真兼容策略(工程落地关键)
Veeda 不准备、也不可能短期完全替代传统物理引擎。 官方工程路线非常务实: Veeda 生成式世界模型负责长尾、未知、随机场景;Isaac Sim 传统物理引擎负责基础物理稳定性兜底。
未来工业落地一定是双引擎混合仿真范式,而非单一模型替代。
4. 全球世界模型赛道完整格局(2026 最新)
把 Veeda 放入赛道全局,更能看清其生态位:
4.1 Veeda AI
- 定位:通用物理世界仿真底座
- 优势:前英伟达团队、纯数据驱动、强动作闭环、通用场景泛化能力最强
- 短板:未公开 API、仍在原型阶段、长时序物理幻觉待优化
4.2 Genesis AI
- 定位:机器人策略模型 + 轻量化世界模型 + 硬件研发三线并行
- 特点:更偏向机器人本体智能,环境仿真能力弱于 Veeda
4.3 Physical Intelligence π
- 定位:纯机器人 VLA 动作策略模型
- 特点:只负责 “机器人手怎么动”,不构建完整物理环境,依赖外部仿真器
4.4 Nvidia Cosmos + Isaac Sim
- 定位:工业级成熟仿真栈
- 特点:生态最强、工程最稳、落地最多,但人工成本高、泛化弱
4.5 Wayve GAIA
- 定位:自动驾驶专用世界模型
- 特点:场景垂直,无法通用到家庭、人形机器人场景
4.6 World Labs(李飞飞团队)
- 定位:3D 空间重建与感知
- 特点:擅长看懂世界,弱于物理动力学推演与交互训练
5. 行业冷思考:世界模型的真实边界与落地挑战
写技术乐观很容易,但工程落地必须看清短板,这也是顶级团队当前最大攻坚方向:
5.1 物理幻觉无法彻底根除
数据驱动模型一定会出现:穿墙、悬浮、物体形变、重力异常等崩坏问题。 纯模型仿真短期内无法满足工业级高精度控制需求。
5.2 算力成本极高
高保真、长时序、可交互的世界模型推演,算力消耗远超普通大模型,规模化商用成本压力巨大。
5.3 评测体系尚未统一
行业目前没有标准的世界模型评测基准,什么是好的物理仿真、如何量化泛化能力,仍在探索。
5.4 正确的未来路径
短期(1–2 年):模型生成场景 + 传统物理引擎兜底的混合仿真 长期(3–5 年):数据驱动世界模型逐步接管大部分通用场景,成为物理 AI 底层操作系统
6. 对 Agent 与具身 AI 从业者的启示
- Agent 瓶颈已经从 “决策能力” 转向 “训练环境” 未来 Agent 卷的不再是 Prompt、不再是 Workflow,而是训练场景的丰富度与真实度。
- 世界模型是下一代评测平台的核心基建 未来自动化 Agent 评测、鲁棒性测试、Corner Case 挖掘,全部依赖生成式世界模型自动造场景、造任务、造极端 Case。
- 仿真生态即将重新洗牌 过去由英伟达一家垄断的机器人仿真生态,即将迎来生成式世界模型的全新变革。
7. 结语
Veeda AI 的诞生,本质上是一次AI 训练范式的底层革命: 从 “人工定义世界、机器学习任务” 走向 “机器自学世界、无限迭代任务”
它不只是一家新初创,而是整个物理 AI 行业的范式转折点。 在未来 1–3 年,随着技术开放、API 落地、混合仿真体系成熟,世界模型会成为所有人形机器人、物理 Agent、具身智能的标配底层基础设施。
谁掌握了可规模化、可交互、高真实度的虚拟世界,谁就掌握了物理 AI 的未来。

浙公网安备 33010602011771号