Paper Reading: Table as a Modality for Large Language Models

Paper Reading 是从个人角度进行的一些总结分享,受到个人关注点的侧重和实力所限,可能有理解不到位的地方。具体的细节还需要以原文的内容为准,博客中的图表若未另外说明则均来自原文。

论文概况 详细
标题 《Table as a Modality for Large Language Models》
作者 Liyao Li, Chao Ye, Wentao Ye, Yifei Sun, Zhe Jiang, Haobo Wang, Jiaming Tian, Yiming Zhang, Ningtao Wang, Xing Fu, Gang Chen, Junbo Zhao†
发表会议/期刊 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
发表年份 2025
会议等级 CCF-A
论文代码 https://github.com/liyaooi/TAMO

作者单位:

  1. Zhejiang University
  2. Ant Group
  3. University of Michigan

研究动机

表格推理是指基于预结构化表格文本生成任务特定回答的过程,涵盖表格问答、表格事实验证、Text-to-SQL、预测任务等多种下游任务。随着大语言模型的兴起,GPT-4、LLaMA 等模型在处理表格数据时普遍采用的策略是将表格序列化为文本格式(如 Markdown 标记语言),再配合少量示例输入模型进行推理,如下图所示。
image

作者提出了一个名为 StructQA 的诊断基准来考察这个问题,表格数据独有的一个结构语义属性是排列不变性,它是指表格的行和列任意重排后语义应保持一致。理想情况下 LLM 对结构等价的表格应保持近似相同的下游任务性能。然而实验结果如下图所示,包括 Llama2-7B、GPT-3.5、GPT-4 以及专门为表格任务训练的 TableLlama 在内的主流模型,在面对排列扰动后的表格时均表现出显著的性能退化。除 GPT-4 外,其他模型的回答鲁棒性均低于 40%。
image

表格本质上是具有排列不变性的结构化数据,文本序列化无法自然保持这一性质。面对结构扰动时,LLM 会产生幻觉和不稳定的推理模式,说明其对表格结构泛化能力的不足。基于此,作者提出将表格编码为一种独立的模态来整合其复杂的关系结构,就像图像和音频包含丰富的语义信息一样,表格也拥有文本序列化无法单独表示的结构特性。

文章贡献

针对 LLM 在表格推理任务中因文本序列化丢失结构信息的问题,本文提出了将表格作为一种独立的模态集成到 LLM 中的 TAMO 框架。TAMO 使用超图增强的表格编码器来学习表格的结构表示,通过超图建模表格的层次结构和排列不变性,然后通过一个对齐投影器将结构表示注入到 LLM 的语义空间中,与序列化文本和问题一起进行自回归推理。在训练时可以选择冻结 LLM 参数,仅学习表格编码器和对齐层。实验在 StructQA、HiTab、WikiTQ、WikiSQL、FeTaQA 五个表格推理数据集上验证了 TAMO 的有效性,在冻结 LLM 设置下相比纯文本模态平均提升 42.65%,在微调设置下也 consistently 优于纯文本方案,并且基于 Llama2-7B 的 TAMO 在结构推理任务上超过了 GPT-4.1 和 DeepSeek-R1。

预备知识

本文涉及以下 2 个基本概念:

  1. 超图:超图 \(G = (V, E)\) 由节点集 \(V\) 和超边集 \(E\) 组成,超图中的每条超边 \(e \in E\)\(V\) 的一个子集,即 \(e \subseteq V\),可以连接任意数量的节点,适合表达集合层面的关系。
  2. 排列不变性:指对输入的任意排列,函数输出保持不变。形式化地说,对于函数 \(f\) 和排列 \(\pi\),若 \(f(\pi(X)) = f(X)\),则 \(f\) 具有排列不变性。在表格场景中,行和列的任意交换不应改变表格的语义。这一性质意味着表格单元格之间的关系应基于集合来建模。

本文使用了多重集函数,它是处理无序集合的工具。本文使用 Set Transformer 来参数化这些多重集函数,其核心是通过注意力机制实现对集合元素的排列不变聚合。一个集合注意力块的定义如下:

\[Multiset(X) = LayerNorm(H + rFF(H)) \]

\[H = LayerNorm(X + MultiHead(S, X, X)) \]

其中 \(S\) 是可训练参数向量,\(rFF\) 是逐行前馈层,\(LayerNorm\) 是层归一化,\(MultiHead\) 是多头注意力机制。

本文方法

TAMO 的整体框架如下图所示,主要包含三个组件:超图增强的表格编码器、对齐投影器、以及与 LLM 的自回归接口。输入表格同时走两条路径,一条通过超图编码器学习结构表示,另一条序列化为格式化文本序列,两者连同问题一起输入 LLM 生成答案。
ScreenShot_2026-08-30_193042_968

问题定义

表格推理被定义为作用于三元组 \((T, Q, A)\) 的任务,符号及其含义如下表所示。给定表格 \(T\) 和问题 \(Q\),目标是预测对应答案 \(A\),即 \(p(A|T, Q)\)

符号 含义
\(T\) 预结构化表格
\(Q = \{q_1, q_2, ..., q_m\}\) 与表格相关的自然语言问题
\(A\) 期望的答案,通常简化为 \(n\) 个 token 的序列

超图增强的表格编码器

表格数据具有层次结构,普通扁平表是这种层次的特例,如下图所示。同一层级内的单元格以及同级别的层次之间表现出排列不变性,因此单元格之间的关系学习应基于集合来建模。
ScreenShot_2026-08-30_193031_210

基于此,作者引入超图架构来建模表格数据,将高阶层次结构和排列不变性作为归纳偏置。对于表格 \(T\),每个叶节点单元格(不包含其他单元格的单元格)被表示为节点 \(v \in V\),每个分支单元格(包含其他单元格的单元格)被表示为超边 \(e \in E\)。每条超边 \(e\) 由属于其层级层次的节点组成。例如在简单扁平表中,每个单元格是一个节点,每一列或每一行是一条包含该列或行所有节点的超边。在这种建模下,交换行或列保持一致的图结构,能有效反映表格的排列不变性。

为建模超图结构内的信息传播,编码器采用 HyperTrans 作为骨干架构。HyperTrans 是一种超图结构感知的 Transformer,编码器集成了两个多重集函数。第一步聚合节点级信息以更新超边表示:

\[x_e^{t+1} = Fusion(x_e^t, Multiset_1(\{x_v^t | v \in e\})) \]

其中 \(t\) 是当前层号,\(x_v\) 是节点 \(v\) 的嵌入,\(x_e\) 是超边 \(e\) 的嵌入,\(Fusion\) 层用于整合前层超边信息,通常采用 MLP 网络。第二步聚合超边信息以更新节点表示:

\[x_v^{t+1} = Multiset_2(\{x_e^{t+1} | v \in e\}) \]

通过节点和超边之间的双向信息传播,模型有效学习表格单元格之间的复杂层次关系,输出可学习的表格特征。

表格结构表示与 LLM 的集成

为最大化利用 LLM 的文本理解和推理能力,作者设计了一个自回归的接口将表格模态的结构表示与 LLM 集成。假设通过表格编码器获得的节点表示为 \(\hat{X}_V \in \mathbb{R}^{|V| \times d_g}\),超边表示为 \(\hat{X}_E \in \mathbb{R}^{|E| \times d_g}\),其中 \(d_g\) 是表格编码器的隐藏维度。使用一个单层 MLP 作为对齐投影器,将表格结构表示映射到 LLM 的语义空间:

\[X_{st} = MLP(Pooling(\hat{X}_V, \hat{X}_E)) \in \mathbb{R}^{d_l} \]

其中 \(Pooling\) 是节点和超边的信息聚合函数(实验中采用均值池化),\(d_l\) 是 LLM 的隐藏维度。在生成答案时,将表格数据序列化为格式化文本序列获得文本嵌入 \(X_{tt} \in \mathbb{R}^{L_s \times d_l}\)\(L_s\) 为文本序列长度),问题 token 嵌入为 \(X_{qt} \in \mathbb{R}^{L_q \times d_l}\)。最终答案基于下一 token 预测范式生成:

\[p(A|T, Q) = \prod_{i}^{n} p(a_i | X_{st}, X_{tt}, X_{qt}, a_{j<i}) \]

训练时可以选择冻结 LLM 参数,仅学习表格编码器和对齐层。作者保留了双输入流,序列化文本 \(X_{tt}\) 提供细粒度的语义内容,基于超图的结构嵌入 \(X_{st}\) 提供全局的关系信息,如行列关系和层次结构。消融实验验证了两种模态协同的必要性。

实验结果

数据集和实验设置

本文选择了五个数据集进行评估:

数据集 描述
StructQA 作者提出的结构推理 QA 数据集,包含 7,500 个 QA 对和 500 张表格。
HiTab 层次表格 QA 数据集,包含 10,672 个问题和 3,597 张表格。
WikiTQ 表格 QA 数据集,包含 22,033 个问题和 2,108 张表格。
WikiSQL 表格 QA 即 NL2SQL**数据集,包含 80,654 个问题和 24,241 张表格。
FeTaQA 自由形式 QA 数据集,包含 10,279 个问题和 3,641 张表格。

对比方法包括四种设置,为公平对比 TAMO 使用相同的基座模型 Llama2-7B。此外还与 GPT-3.5、GPT-4、GPT-4.1、DeepSeek-R1 等通用大模型进行了对比。

对比方法 方法简介
仅推理(Zero-shot) 直接对序列化的表格序列和问题进行推理,作为基线。
冻结LLM 与 Prompt Tuning 相比,提示调优在序列化表序列前添加了一些参数化和训练的令牌。
LoRA 微调 使用 LoRA 微调 LLM 的参数,在方法中添加可选的 LoRA 作为 TAMO + LoRA。
全参数 SFT 对 LLM 的所有参数进行监督微调,TAMO + SFT​ 表示 TAMO 和 LLM 的联合监督训练

主要对比实验

主要结果如表所示,在冻结 LLM 设置下,TAMO 相比纯文本模态(Prompt Tuning)平均提升 42.65%,在 HiTab 上最高提升 86.06%。在 LoRA 微调设置下,TAMO+LoRA 相比纯 LoRA 平均提升 28.27%。在 SFT 设置下,TAMO+SFT 相比纯 SFT 平均提升 9.71%,并在所有任务上接近或达到 Specialist SOTA 的水平。
image

值得注意的是,基于 Llama2-7B 的 TAMO+SFT 在 StructQA 上显著超过 GPT-4.1(71.60 vs 60.33)和 DeepSeek-R1(71.60 vs 57.47),在 WikiSQL 上也大幅领先这两个模型(85.90 vs 71.21 和 71.91)。在 HiTab 表格数据集上,TAMO+SFT 达到了 63.89% 的准确率,接近 Specialist SOTA 的 64.71%,说明超图编码器能有效学习复杂层次关系。在知识密集型的 WikiTQ 上略逊于 DeepSeek-R1(75.76 vs 45.81),但 TAMO 仅基于 7B 参数的模型,说明了 7B 小模型在结构推理上的有效性。

案例研究

作者对 WikiSQL 测试集中的一个样本进行了注意力可视化分析,该样本中基线方法(仅推理)回答错误,TAMO 回答正确。可视化结果显示 TAMO 认为"Canada"(正确答案)和"USHL"(相关关联信息)的 token 对最终答案更重要,基线方法基本忽略了这些关键 token。同时 TAMO 对 [table_structure_token] 表现出一定的注意力,该 token 的加入影响了其他输入 token 的重要性分布,促使 LLM 更聚焦于与正确答案相关的 token。说明 TAMO 学习的结构信息通过优化关键表格信息的注意力关系来增强 LLM 的推理能力。
image

排列鲁棒性实验

排列不变性是表格数据独特的结构属性,作者通过随机打乱 StructQA 测试集表格的行列来评估模型的鲁棒性,训练集保持不变。结果如图所示,在冻结 LLM 和微调 LLM(LoRA 和 SFT)设置下,TAMO 均持续优于纯文本模态方法,并展现出最佳的排列后答案一致性。说明 TAMO 能使 LLM 在多样化表格结构变化上实现更优的泛化。

image

表格编码器有效性分析

为进一步验证表格编码器学习表格结构的有效性,作者运行了一个预测单元格是否属于特定行或列的二分类任务。在 WikiTQ 上训练 50 个 epoch 后用 F1 评估,结果如下表所示。没有编码器的 MLP 分类器仅获得 5.39% 的 F1,随机初始化的编码器达到 49.73%,使用预训练编码器后所有模型均超过 60% 的 F1,其中 StructQA 最高达 71.32%。这些在不同数据集上预训练的编码器在 WikiTQ 测试集上一致评估的结果表明,TAMO 的超图表格嵌入能有效编码和泛化结构关系。
image

消融实验

在 StructQA 上对比了三种配置:仅图结构(Graph-only)、仅文本(Text-only)、完整 TAMO(Both),在 PT、LoRA、SFT 三种设置下评估。结果如表所示,仅图结构的方法在生成任务上一致失败,准确率低于 8%,证实结构信息若无语义支撑是不充分的。仅文本模型表现较好,准确率和鲁棒性均低于完整模型。只有完整的 TAMO 框架实现了最高性能和鲁棒性,从经验上验证了结构和文本两种模态协同的必要性。
image

其他补充结果

表格结构 token 数量消融

在冻结 LLM 设置下于 WikiTQ 上评估了不同数量的表格结构 token(1、3、5、7、9)。结果表明当 token 数量为 2 或以上时模型最终性能持续相似,说明最少一个 token 就足以解释表格中的结构信息,体现了该方法的高效性。
image

不同 LLM 的扩展性

除 Llama2-7B 外,作者还在 TableLlama、Mistral-7B、LLaMA 3.1 8B 上验证了 TAMO 的效果。结果显示即使是已经过监督微调的 TableLlama,加入 TAMO 的表格结构信息后仍能进一步提升。LLaMA 3.1 8B 的基线更强,加入表格编码器后仍一致提升,部分数据集增益超过 10%。
image
image

多表场景有效性

在 MultiTabQA-geoQuery 数据集上验证多表场景,在 SFT 设置下 TAMO+SFT 相比 SFT 在 F1 上提升 107.09%(33.59 vs 16.22),Precision 提升 61.57%,Recall 提升 130.62%,表明 TAMO 在多表场景中同样有效。
image

计算效率分析

在 WikiTQ 数据集上运行 1 个 epoch 的时间对比表明,TAMO 的运行效率快于 LoRA,TAMO+LoRA 相比 LoRA 仅略有增加。在冻结 LLM 设置下由于仅需训练轻量级的表格编码器和对齐投影器,训练时间远低于 LoRA 或全参数 SFT。
image

优点和讨论

个人认为,本文有如下一些优点和创新点可供参考学习:

  1. 本文以排列不变性作为超图建模的理论依据和主要针对的假设,TAMO 将表格定位为与图像、音频并列的独立模态,通过模态编码器加 LLM 的多模态框架同步进行进行表格序列化和表格表示学习。
  2. 序列化文本提供细粒度语义内容,结构嵌入提供全局关系信息,两种信息能够形成互补,消融实验验证了两者协同优于任一单流。
  3. 表格编码器作为即插即用的组件运行,不需要修改 LLM 架构。在冻结 LLM 设置下仅训练轻量级编码器和对齐投影器,计算效率优于 LoRA,在 Llama2、Mistral、LLaMA 3.1 上均有效。
  4. 实验涵盖消融实验、注意力可视化、跨数据集泛化、多表场景验证等,注意力可视化直观展示了结构 token 如何引导 LLM 聚焦关键信息。

我觉得论文可以被认为做了一个模型更好地提取表格数据的结构关系信息,利用它去校正 LLM 因序列化而丢失的不变性,从而让回答更准确。除了改进 LLM 在表格问答上的性能,更重要的在于 TAMO 论证了表格数据里值之间的结构关系信息的重要性,例如谁和谁在同一行、谁被谁包含、哪个表头管着哪些子列等。在类似的研究中,可以考虑如何参考本工作更好地去提取、利用表格的信息给 LLM,而不是指望它能从 flatten 的文本里自己恢复。

posted @ 2026-08-31 01:01  乌漆WhiteMoon  阅读(21)  评论(0)    收藏  举报