交个朋友吧

AIGC标识 LLM4Onto自动构建领域本体

在人工智能领域,知识图谱是支撑智能问答、推荐系统、搜索引擎等应用的核心技术。而知识图谱的“骨架”——本体(Ontology),则定义了图中实体类型以及它们之间的逻辑关系,比如“恶意软件”是一种“威胁实体”,“攻击者”使用“恶意软件”等。然而,构造一个高质量的本体通常需要领域专家耗费大量时间手工完成,这成为知识图谱构建的瓶颈。

近年来,大语言模型(LLM)展现出强大的自然语言理解能力,人们开始尝试让LLM来自动生成本体。但现有方法往往要求预先定义好固定的类别,或者依赖专家设计的模板,限制了模型从真实文本中自由发现知识的能力,导致“数据无法说话”。此外,直接让LLM生成本体还会产生严重的“幻觉”问题,即模型编造出原文中不存在的概念或关系。

针对这些挑战,一篇名为《LLM4Onto: Automated Domain Ontology Construction Using Large Language Models》的论文提出了一种全新的框架——LLM4Onto,它能够直接从原始文本中自动构建领域本体,不需要任何人工标注,真正做到了“让数据说话”。

三步走:从文本到本体

LLM4Onto的核心流程分为两个主要阶段:本体命名关系提取。整体设计遵循“化整为零”的思想,将庞大的本体构建任务拆解成多个LLM擅长的小任务,从而大幅降低幻觉风险。

第一步:发现“实体类型”——本体命名

本体本质上是对现实世界中实体类型的抽象,比如“酒店”“餐厅”“威胁行为体”等。LLM4Onto首先利用SpaCy工具提取文本中的所有名词和名词短语,然后过滤掉代词等无明确语义的词。接着,它将剩下的名词通过BERT转换为语义向量,并采用亲和传播聚类算法自动将它们分组,无需事先指定要分成几类。

这种聚类方式能自然地发现潜在的实体类型——比如将“APT28”“Lazarus Group”等名词聚在一起,暗示它们可能属于同一类。之后,LLM4Onto将这些聚类结果输入大语言模型,让模型根据聚类中的实体名称发挥归纳能力,为每个聚类赋予一个准确的本体名称(如“威胁行为体”)。如果聚类大小不足,还会被自动过滤以提升质量。

第二步:捕捉类型间的关系——HT-R-O范式

有了本体节点,还需要知道它们之间如何关联。LLM4Onto独创了HT-R-O(头实体-尾实体-关系-本体)范式,分三层实现关系提取:

  1. 实体级关系提取:将之前标记好的实体-本体对和原文片段一并输入LLM,让模型找出片段中实体之间的具体关系,生成形如(实体A,关系,实体B)的三元组。例如从“Lazarus Group使用TrickBot”中提取出(Lazarus Group,使用,TrickBot)。
  2. 本体级关系抽象:利用实体与本体的映射关系,将上述三元组中的实体替换为本体类型,得到(威胁行为体,使用,恶意软件家族)这样的本体级关系。
  3. 关系标准化:由于LLM生成的原始关系表达多样化(如“使用”“利用”“借助”可能表达同一意思),这一步将所有本体级三元组再次输入LLM,由模型合并语义相同的关系,输出统一的关系集,最终形成标准化的本体关系图。

整个过程中,LLM被严格限定在原文提供的证据内,不允许凭空创造,从而有效抑制了幻觉。

实验表现:限制域中表现优异,通用域中仍有空间

为了验证效果,研究团队在多个数据集上进行了测试,包括对话数据集MultiWOZ、百科类Wikipedia、学术摘要ArXiv以及一个真实的网络安全威胁情报数据集。

MultiWOZ(多领域对话)上,LLM4Onto在所有指标上大幅领先对比方法,Literal F1达到49.5%(对比方法仅2.8%),Fuzzy F1、Continuous F1等也表现突出。这是因为对话领域语义集中,LLM4Onto能充分施展归纳能力。

ArXiv学术数据集上,LLM4Onto在Literal F1、Continuous F1和Graph F1上均取得最高分,尤其在结构敏感的Graph F1中表现优异,说明它不仅能发现概念,还能构建出逻辑清晰的层次结构。

网络安全数据集上,LLM4Onto生成了高达483个实体类型和72种关系类型,远超现有网络安全命名实体识别模型(如SecureBERT仅支持40种类型),而且这些模型大多不包含关系建模。LLM4Onto生成的本体为未来更强大的网络安全知识图谱系统提供了关键语义蓝图。

不过,在开放域的Wikipedia数据集上,LLM4Onto的总体指标略低于部分基线模型。分析发现,这是因为Wikipedia包含大量跨领域词汇,且真实本体较粗粒度,而LLM4Onto倾向于生成更细粒度的本体,导致对齐困难。这提示未来需要改进粒度匹配问题。

样例:从网络安全文本到领域本体

输入文本数据集(片段)

假设我们有以下两段来自威胁情报的文本:

  1. “APT28, a threat actor linked to Russia, used XAgent malware to steal data from Microsoft.”
  2. “Lazarus Group, a North Korean hacking group, deployed TrickBot ransomware against financial institutions.”

阶段一:本体命名(Ontology Naming)

① 名词提取与过滤
使用SpaCy提取所有名词和名词短语,并过滤代词等无清晰语义的词,得到:

  • 文本1: APT28, threat actor, Russia, XAgent, malware, data, Microsoft
  • 文本2: Lazarus Group, North Korean, hacking group, TrickBot, ransomware, financial institutions

② 语义聚类
用BERT生成嵌入向量,再通过亲和传播聚类(无需指定聚类数),得到若干簇。经过后处理(保留成员数≥2的簇),假设得到以下四个簇:

成员(实体) 聚类依据
簇1 APT28, Lazarus Group 具体威胁组织
簇2 XAgent, TrickBot 恶意软件/工具
簇3 Microsoft, financial institutions 目标机构/组织
簇4 Russia, North Korean 国家/地区

其他词如 threat actor, hacking group, malware, ransomware, data 因成员数不足被丢弃,或属于通用描述未形成独立簇。

③ LLM 命名与合并
将每个簇的实体列表及上下文示例输入大语言模型,采用附录A中的提示模板(中心词+最近词),让LLM输出本体标签。例如:

  • 簇1(中心词 APT28,最近词 Lazarus Group)→ Threat Actor
  • 簇2(中心词 XAgent,最近词 TrickBot)→ Malware Family
  • 簇3(中心词 Microsoft,最近词 financial institutions)→ Organization
  • 簇4(中心词 Russia,最近词 North Korean)→ Nations and Regions

如果存在语义相近的簇(如“威胁行为体”和“黑客组织”),LLM会在多轮对话中合并它们,最终得到统一的本体节点集合。

阶段一输出(本体节点)
Threat Actor, Malware Family, Organization, Nations and Regions


阶段二:关系提取(HT-R-O 范式)

① 实体级关系提取
将实体-本体对与原始文本一起输入LLM,让模型提取实体间的关系三元组。例如:

  • 文本1:
    (APT28, used, XAgent)
    (APT28, linked to, Russia)
    (XAgent, used to steal, data) → 但 data 为目标类型,由于 data 未被保留为本体节点,此关系可能被忽略或后续处理。
  • 文本2:
    (Lazarus Group, deployed, TrickBot)
    (Lazarus Group, against, financial institutions)
    (TrickBot, is a, ransomware)ransomware 未保留,忽略。

② 本体级关系抽象
利用实体到本体的映射,将上述三元组中的实体替换为本体类型:

  • (Threat Actor, used, Malware Family)
  • (Threat Actor, linked to, Nations and Regions)
  • (Threat Actor, deployed, Malware Family)
  • (Threat Actor, against, Organization)

③ 关系标准化
将所有本体级三元组再次输入LLM,让模型合并语义相同的关系。例如:

  • useddeployed 都表示“使用”,合并为 uses
  • linked to 可能标准化为 associated with
  • against 表示“针对”,合并为 targets

最终得到标准化关系集:uses, targets, associated with


最终输出:领域本体图

  • 节点Threat Actor, Malware Family, Organization, Nations and Regions
  • 关系
    • Threat ActorusesMalware Family
    • Threat ActortargetsOrganization
    • Threat Actorassociated withNations and Regions

该本体完全由数据驱动,严格遵循原文语义,体现了“让数据说话”的核心原则。同时,通过将复杂任务分解为聚类、命名、关系提取、标准化等子任务,LLM的幻觉问题被显著抑制。


样例小结

该样例完整覆盖了LLM4Onto的两个关键阶段:

  • 本体命名:无监督聚类 + LLM归纳,自动发现实体类型(节点);
  • HT-R-O范式:从实体级关系到本体级关系再标准化,自动构建类型间关系(边)。

最终生成了一个可直接用于指导知识图谱构建的轻量级领域本体架构。在真实网络安全数据集上,LLM4Onto可扩展到483个实体类型和72个关系类型,展示出强大的专业领域本体构建能力。

总结与展望

LLM4Onto提出了一种数据驱动的自动化本体构建新范式,通过亲和传播聚类和HT-R-O关系提取范式,成功将LLM的“幻觉”问题控制在可接受范围,并在受限领域(如对话、学术、网络安全)中展现出强大的实用价值。它的核心理念——“让数据说话”——为知识工程提供了一种可扩展、可迁移的解决方案。

未来的工作将聚焦于优化通用域的构建精度,开发更精准的层次关系提取范式,进一步提升本体命名的一致性和细粒度本体的对齐能力。随着大语言模型能力的持续提升,LLM4Onto这类方法有望彻底改变知识图谱的构建方式,让机器从海量文献中自动提炼出人类可理解的知识结构。


本文基于论文《LLM4Onto: Automated Domain Ontology Construction Using Large Language Models》撰写,作者:Guige Ouyang, Yinhao Tang, Yongzhong Huang。

posted @ 2026-07-30 22:39  PamShao  阅读(68)  评论(0)    收藏  举报