机器学习笔记(24): MuMA-ToM
可能更好的阅读体验 Jeefy's Blog: MuMA-ToM
- ToM (Theory of Mind)
是一种推测他人意图、情绪、目的等心智状态的能力。
ToM 被用于评估 AI 在多智能体、多模态社交互动中的推理能力。
该 benchmark 分为 3 类子问题:
- belief inference
- social goal inference
- belief of goal inference
其中,belief inference 我理解为信念推断,也就是主体在主观上对于客观事实的看法,感受或者理解。social goal inference 就是社交目的推断,也就是主体在主观上想要做的事情是什么。
所以这里其实分为 3 种变量:
- 主观意图
- 主观对于客观的认知
- 对他人目标的信念
客观行为,主观意图,主观对客观的认知三者互相依赖和确定,确定其二便可推出其一,所以这是这个 benchmark 分类的主要依据。
- benchmark 是怎么构建的?
参考了 GOMA 生成动作和对话的方法。
作者采用 VirtualHome 搭建虚拟场景,每条数据,在随机场景和随机合法认知条件下组合。虚拟场景内,由两个 Agent 扮演两人进行活动。
两个 Agent:
- 只能"看到"自己所在房间里的东西,看不到整个房子的全局状态
- 只知道自己的行为和意图,不知道对方的意图
也就是初始,对于每个 Agent,知道:
- 自己在哪里
- 物理目标
- 初始的信念(某个东西在哪里)
- 社交意图
然后由规划器,计算两个 Agent 的行动路线。
动作规划完成后,根据规则生成对话:
- 如果两个 Agent 在同一个房间,并且一个不确定某个东西在哪里,那么就会发问。
- 被问的一方按自己的社交意图回答
- 发问方随后更新信念
然后根据这些信息,构建视频、问题等数据即可。
对于这个 benchmark,首要的便是:对于人类来说,其是否清晰。从数据来看,人类可以达到 93.5% 的正确率,以及对于答案 98.9% 的认可率,所以数据集本身是合理的。
对于模型表现,现有的模型表现都不好:

所以这个论文所研究的问题成立,这确实是当前大模型所存在的问题:对于其他主体的意图理解能力很弱。
- 为什么会很弱?
主要问题有两个:
- 难以分辨主观恶意,以及主观恶意下却造成了客观帮助的情况。当主观恶意是条件是,判断依旧不准确。
- 视觉识别不准确,尤其是当物品过小或者因为任务动作被遮挡的时候,视觉和文本没有办法很好的耦合。
- LIMP
我感觉是说,现在的大模型都是 “先验” 模型(从主观到客观),而不是 “后验” 模型(从客观反推主观),而且更偏向于仅考虑客观的内容,所以才诞生出了将 “后验” 转化为 “先验” 的想法。
将问题统一转化为:
如果我有某样的主观意愿和某样的主观认知,我会做什么?
然后依据这个假设,交给 LLM 做前向预测,得到一个动作序列。将这个动作序列和实际动作序列对比:
其中 \(P(H)\) 是先验,那就 \(\frac 1 n\) 均匀就行。
后面这些,本质上就是看,某个心理假设,能不能全程支持这些行为。每一步都合理,似然就高;有不合理的,那就低。
那么求这个概率就是一个工程问题了。
依旧是正难则反,通过 GPT-4o 二元判断是否可能,进一步确认概率。
于是,就可以通过三个先验的评分,得到答案。
但是对于图像这个问题,解决就很粗暴,直接 captioner 转写视频,对于看不清的留空(some object),让判断的 LLM 通过问题和上下文去补全,以及从动作序列反推物品的位置在哪里。这既绕开了场景图识别的难点,也自动过滤无关物体。

浙公网安备 33010602011771号