大模型“下海”做知识工程:是万能助手还是摸鱼新手?
- 标题: Large Language Models for Ontology Engineering: A Systematic Literature Review
- 作者: Jiayi Li, Daniel Garijo, María Poveda-Villalón
- 发表时间: 2025年
- 核心发现: 大模型在构建本体(知识图谱的“骨架”)中作用显著,主要集中在实现阶段(63.4%),但面临缺乏标准化评估、易产生幻觉、难以复现等问题。未来应走向人机协作的混合模式,并建立统一的评估基准。
引言:AI界的“新工种”
提起大语言模型(LLM),你可能会想到能写诗、能编程的ChatGPT。但你可能不知道,AI界最近给大模型安排了一个“新工种”——知识工程师。
这个“新工种”可不是随便聊聊天那么简单,它负责构建整个知识世界的“骨架”。一篇2025年发表的系统综述论文,就像一份“体检报告”,详细盘点了GPT、LLaMA这些顶流大模型,在干这个“技术活”时,到底表现如何。
一、什么是“知识工程”?为什么难?
在AI界,为了让计算机真正“理解”世界,科学家们发明了知识图谱(比如谷歌搜索背后的知识库)。而支撑知识图谱的,就是本体。
可以把本体想象成一张极端精细的交通地图。它不仅标出了“路名”(概念),还定义了“是不是单行道”、“限速多少”、“红绿灯规则”(关系与约束)。比如,定义一个“智能手机”,它不仅要说明“是电子设备”,还要规定“必须包含操作系统”,且“不能是台式机”。
构建这张地图的复杂过程,就是本体工程。这个过程极其复杂,通常需要领域专家和工程师耗费数月,反复推敲,一不小心就会出错,是个典型的“老法师”才能干的活。
二、大模型在知识工程中扮演什么角色?
论文对30篇论文、41个实验方案进行了系统分析,发现大模型在本体工程中扮演了三个主要角色:
1. 本体工程师(最核心角色)
大模型可以自动化完成本体设计、开发和维护的多个环节。例如:
- 解析非结构化文本,生成结构化的需求规格
- 将能力问题自动翻译成SPARQL查询语句
- 将自然语言描述直接转换为OWL代码
- 甚至端到端地完成从需求到编码的完整本体构建
2. 领域专家
大模型凭借海量训练数据,能像半个专家一样:
- 生成领域相关的概念和术语定义
- 发现概念之间的潜在关系
- 生成本体文档和功能摘要
- 评估本体的一致性和正确性
3. 评估员
大模型还被用来验证本体公理、检测逻辑不一致。例如,ChatGPT-4在验证本体限制条件时,准确率高达92.2%,通过集成聚合方法甚至能提升到96.7%。
三、大模型“偏科”严重:哪些阶段最受关注?
论文按照LOT本体工程方法论,将本体开发分为四个阶段,并统计了大模型在各阶段的研究分布:
| 阶段 | 任务占比 | 具体任务 |
|---|---|---|
| 需求规格说明 | 24.4% | 功能需求编写、能力问题逆向工程、需求形式化 |
| 实现阶段 | 63.4% | 概念化、编码、匹配、评估 |
| 发布阶段 | 9.8% | 文档生成 |
| 维护阶段 | 2.4% | Bug检测 |
可以看出,实现阶段占据了绝对主导地位,尤其是在概念化(22.0%)和编码(19.5%)这两个任务上。而维护阶段几乎无人问津——这就像一个擅长建新房,却不擅长后期维修的工人。
四、构建本体库的现有技术路线
论文概括了当前利用大模型构建本体库的三种主要技术路线:
路线一:端到端自动化生成(纯LLM驱动)
- 特点:将自然语言文本、能力问题或结构化数据直接输入LLM,由LLM自动输出完整的本体代码
- 代表方案:NeOn-GPT(Fathallah等)、SPIRES(Caufield等)、OLaLa(Hertling和Paulheim)
- 优点:速度快,自动化程度高
- 局限:易产生幻觉,缺乏逻辑一致性保证,需要后续专家验证
路线二:交互式人机协作(Human-in-the-Loop)
- 特点:LLM生成初稿,人类专家(领域专家或本体工程师)进行审核、修正、迭代反馈
- 代表方案:Doumanas等(SAR本体)、Kholmska等(主动学习扩展)、Zhang等(OntoChat)
- 优点:兼顾效率和准确性,能处理复杂领域知识
- 论文发现:仅4项研究明确涉及人类参与,但论文认为这是未来最有前景的方向
路线三:混合神经符号方法(Neuro-Symbolic,未来方向)
- 特点:将LLM的生成能力与规则推理器(如描述逻辑推理机)结合,由LLM提出建议,逻辑系统进行一致性验证
- 现状:论文将其列为未来研究方向,目前直接将该路线作为完整方案的成熟研究较少
- 论文建议:这是克服LLM“浅层推理”和“幻觉”问题的关键路径
五、用的模型五花八门,各有千秋
论文将使用的模型分为四大类:
1. GPT系列(GPT-3.5、GPT-4、GPT-4 Turbo/4o)
- 最广泛使用,尤其擅长复杂推理和高质量代码生成
- 在能力问题逆向工程、编码和评估任务中表现突出
2. 开源大模型(LLaMA、Mistral、Claude等)
- 在匹配不同本体、识别概念关系上表现优秀
- 成本更低,更受学术界欢迎
- Hertling和Paulheim(2023)微调LLaMA用于本体匹配,在OAEI基准测试中取得良好效果
3. 轻量级指令调优模型(Mistral-7B、Falcon-7B等)
- 提供更高效的解决方案
- 在能力问题逆向工程和本体创建中表现出色
4. 基于Transformer的架构(T5、BERT)
- 主要支持句子编码、分类和结构化生成
- 在知识提取和文档生成任务中发挥作用
六、漂亮成绩单下的“三大隐忧”
尽管很多论文都给出了亮眼数据,但论文也毫不留情地指出了目前的“致命伤”:
1. “考试没有统一标准!”
这是最大的痛点。每个研究都在用自己的一套考题(数据集)和评分标准。有的用F1分数,有的找专家打分,有的看语义相似度。这就导致了A研究说GPT-4拿了90分,B研究说LLaMA拿了85分,但两者根本没法比。“学术界的‘公信力’和‘可复现性’受到了严重挑战。”
2. “AI会胡编乱造(幻觉)!”
大模型常见的“幻觉”问题在知识工程中被放大。它可能会编造出根本不存在的概念或关系。与形式逻辑系统相比,LLM的推理能力仍然相对较浅,可能生成虚构的事实或关系,且对如何产生输出的透明度有限。此外,LLM往往违反基本的本体约束,如类互斥性、层次结构和定义域/值域限制。
3. “黑箱操作,难以复现!”
很多研究没有公开实验代码或详细数据。41项研究中,仅4项提供了完整的开源实验代码。这就导致了一个尴尬的局面:别人无法复现你的结果,也无法验证你的结论。
七、应用领域:从医疗到美食
论文发现,大模型在本体工程中的应用领域非常广泛:
- 医疗与生命科学(最活跃):验证SNOMED CT和UMLS等大型生物医学术语系统的本体约束,辅助Dementia Care等疾病领域本体开发
- 文化遗产:增强DOREMUS、Polifonia和Odeuropa等音乐和嗅觉文化遗产本体
- 金融:自动生成能力问题,用于金融行业商业本体(FIBO)
- 应急与安全:构建搜索与救援(SAR)本体
- 自动驾驶:建模交通场景
- 学术研究:结构化分类研究主题(如计算机科学本体CSO)
- 食品领域:增强食品本体,从食谱文本中提取结构化数据
八、未来之路:人机协作,优势互补
这篇综述论文没有吹捧大模型,也没有唱衰它。它得出了一个非常清醒的结论:大模型不是万能药,但确实是强大的加速器。
论文给未来的研究指出了四条路:
1. 建立“高考”标准
学术界需要像高考一样,建立统一的、公开的基准测试,让所有模型在同一标准下公平竞争,才能真正分出高下,推动技术进步。
2. 走“神经符号”路线
把大模型的“直觉”和传统逻辑系统的“严谨”结合起来。让AI提建议,让逻辑程序做验算,从根源上解决“幻觉”问题。
3. 拥抱“持续学习”
让AI能够动态地更新知识,而不是像现在这样,训练完就“定格”了,这样才能支持长期的知识维护。
4. 增强真实世界的鲁棒性
优化提示工程方法,减少对结构化输入的依赖,增强LLM对实际应用场景的适应性。
总结
这篇论文就像一张“X光片”,清晰地照出了大模型在知识工程领域的“肌肉”和“短板”。它让我们看到,AI正在从“吟诗作对”的聊天机器人,进化成能够参与构建人类知识体系的“工程师”。虽然它现在还是个经验不足、偶尔会犯错的“实习生”,但在人类专家的指导下,它正在飞速成长。
未来,构建庞大、复杂的知识图谱,或许将不再是少数精英的专利,而是一场由AI辅助、全员参与的智慧共创。

浙公网安备 33010602011771号