机器学习笔记(24): MuMA-ToM

可能更好的阅读体验 Jeefy's Blog: MuMA-ToM

  • ToM (Theory of Mind)

是一种推测他人意图、情绪、目的等心智状态的能力。

ToM 被用于评估 AI 在多智能体、多模态社交互动中的推理能力。

该 benchmark 分为 3 类子问题:

  • belief inference
  • social goal inference
  • belief of goal inference

其中,belief inference 我理解为信念推断,也就是主体在主观上对于客观事实的看法,感受或者理解。social goal inference 就是社交目的推断,也就是主体在主观上想要做的事情是什么。

所以这里其实分为 3 种变量:

  1. 主观意图
  2. 主观对于客观的认知
  3. 对他人目标的信念

客观行为,主观意图,主观对客观的认知三者互相依赖和确定,确定其二便可推出其一,所以这是这个 benchmark 分类的主要依据。


  • benchmark 是怎么构建的?

参考了 GOMA 生成动作和对话的方法。

作者采用 VirtualHome 搭建虚拟场景,每条数据,在随机场景和随机合法认知条件下组合。虚拟场景内,由两个 Agent 扮演两人进行活动。

两个 Agent:

  • 只能"看到"自己所在房间里的东西,看不到整个房子的全局状态
  • 只知道自己的行为和意图,不知道对方的意图

也就是初始,对于每个 Agent,知道:

  • 自己在哪里
  • 物理目标
  • 初始的信念(某个东西在哪里)
  • 社交意图

然后由规划器,计算两个 Agent 的行动路线。

动作规划完成后,根据规则生成对话:

  • 如果两个 Agent 在同一个房间,并且一个不确定某个东西在哪里,那么就会发问。
  • 被问的一方按自己的社交意图回答
  • 发问方随后更新信念

然后根据这些信息,构建视频、问题等数据即可。


对于这个 benchmark,首要的便是:对于人类来说,其是否清晰。从数据来看,人类可以达到 93.5% 的正确率,以及对于答案 98.9% 的认可率,所以数据集本身是合理的。

对于模型表现,现有的模型表现都不好:

所以这个论文所研究的问题成立,这确实是当前大模型所存在的问题:对于其他主体的意图理解能力很弱。


  • 为什么会很弱?

主要问题有两个:

  1. 难以分辨主观恶意,以及主观恶意下却造成了客观帮助的情况。当主观恶意是条件是,判断依旧不准确。
  2. 视觉识别不准确,尤其是当物品过小或者因为任务动作被遮挡的时候,视觉和文本没有办法很好的耦合。

  • LIMP

我感觉是说,现在的大模型都是 “先验” 模型(从主观到客观),而不是 “后验” 模型(从客观反推主观),而且更偏向于仅考虑客观的内容,所以才诞生出了将 “后验” 转化为 “先验” 的想法。

将问题统一转化为:

如果我有某样的主观意愿和某样的主观认知,我会做什么?

然后依据这个假设,交给 LLM 做前向预测,得到一个动作序列。将这个动作序列和实际动作序列对比:

\[P(H | a_i, u_i, a_j, u_j, s) \propto P(H) \prod_{t = 1}^T \pi(a_i | \cdots) \pi(u_i | \cdots) \]

其中 \(P(H)\) 是先验,那就 \(\frac 1 n\) 均匀就行。

后面这些,本质上就是看,某个心理假设,能不能全程支持这些行为。每一步都合理,似然就高;有不合理的,那就低。

那么求这个概率就是一个工程问题了。

依旧是正难则反,通过 GPT-4o 二元判断是否可能,进一步确认概率。

于是,就可以通过三个先验的评分,得到答案。

但是对于图像这个问题,解决就很粗暴,直接 captioner 转写视频,对于看不清的留空(some object),让判断的 LLM 通过问题和上下文去补全,以及从动作序列反推物品的位置在哪里。这既绕开了场景图识别的难点,也自动过滤无关物体。

posted @ 2026-09-26 21:06  jeefy  阅读(4)  评论(0)    收藏  举报