AIGC标识 用了 RAG 两年后,我们发现 AI 真正的问题是没知识

两年前我们开始做知识库的时候,第一件事就是把资料全扔进 RAG。

RAG,Retrieval Augmented Generation,检索增强生成,这几年企业做 AI 知识库基本都是从它开始的。路子也很统一,把 PDF、Word、网页资料传上去,系统切分文档,生成向量,存进向量数据库。用户提问,先靠相似度检索捞回来几段相关片段,再交给大模型,答案就出来了。

这条路径快,管用,也撑起了大批 AI 应用落地。

可用了两年,我们慢慢觉得不对劲。

RAG 让 AI 找到了资料,却没让 AI 理解知识。这两件事差得很远。


一、我们曾经也相信 RAG 能解决一切

最初做长文本生成产品,我们选的就是 RAG 路线。想法很朴素,让大模型读着企业资料、行业文档、专业报告,生成像样的内容。

于是我们试了 RAGFlow,也认真研究了 Dify。整条技术链路大概是这样。

原始文档
    ↓
文档解析
    ↓
Chunk切分
    ↓
Embedding向量化
    ↓
向量数据库
    ↓
检索相关内容
    ↓
大模型生成

这套模式确实解决了不少问题。企业制度问答、产品资料查询、内部文档助手、技术资料搜索,这些场景效果都很好。

但场景一旦从问一个问题变成交付一份完整内容,情况就不一样了。

让 AI 根据几十份历史资料写人物传记,对着一堆报告做投资分析,拿地方志整理一个地区的发展史。这类任务一上手,问题就冒出来了。

模型找得到资料。只是这些资料本身,还没变成知识。


二、相关内容不是知识

传统 RAG 的逻辑是,用户提问,系统找出最相关的几个文本片段,交给大模型作答。

听起来没毛病。但对大模型来说,一个 Chunk 只是一次性的上下文输入。这段内容属于哪个实体,这个人物跟哪些事件有关,这个事实出自哪个来源,不同资料之间有没有冲突,哪些内容已经确认,哪些只是猜测,它一概不知。

比如一个历史人物的资料,传统知识库可能是这么存的。

chunk001:
某人在某年担任某职位……

chunk002:
某人在另一个时期参与某事件……

chunk003:
某人的后代情况……

检索到了吗?都检索到了。可这些片段之间没有任何关系。

你想想,模型每回答一次,就得把理解、关联、总结、生成重新走一遍。

也就是说,每调用一次 AI,都在从头整理一次知识。

这才是传统 RAG 最累的地方。


三、AI 时代真正需要的是能被理解的知识

后来我们开始留意另一条路,其中一个启发来自 llm-wiki 这样的项目。

它的思路不一样。文档不是存起来等着被检索,而是让 AI 帮忙,把文档一点点整理成结构化知识。

这个变化很关键。处理链路整个变了。

Document
    ↓
Chunk
    ↓
Vector
    ↓
Search

变成

Document
    ↓
Knowledge Extraction
    ↓
Entity
    ↓
Relationship
    ↓
Concept
    ↓
Source
    ↓
Knowledge

一句话,以前的知识库存的是资料,往后的知识库存的是知识。


四、未来的知识库是给 AI 用的

过去几十年的知识库,都是给人用的。

拿企业文档管理系统来说,它解决的是员工去哪找文件这件事。所以核心能力就是分类、搜索、权限、文件管理,全是围着人转的。

到了 AI 时代,要求变了。光让人找到资料不够,还得让大模型能长期理解这些资料。

知识库要提供的东西就不一样了。

1. 知识对象

人物是人物,事件是事件,概念是概念,每一类都有固定结构。

人物

姓名
出生时间
经历
关系
作品

事件

时间
地点
参与者
影响
来源

概念

定义
上下文
关联知识

2. 知识关系

AI 不该只知道王某出现在三个文档里,它该知道王某参与了什么事件,这个事件又影响了什么变化。

王某
 |
 |参与
 ↓
某历史事件

 |
 |影响
 ↓

某制度变化

关系让知识产生价值。

3. 知识来源和可信度

未来 AI 最头疼的问题会是可信。生成能力已经够用了,难的是说出来的东西有人信。

一个知识系统应该答得上来这些问题,这个结论从哪来的,有几个来源支撑,有没有不同观点,上次更新是什么时候。

所以 Source、Claim、Version、Evidence 这几个概念,我们觉得未来知识库里少不了。


五、RAG 不会消失,它会变成知识系统的一部分

说到这得澄清一个容易误会的地方。

未来不是结构化知识库替代 RAG。RAG 不会消失,它会变成更大知识系统里的一个组件。

以后大概是这样。

                原始资料
                   |
                   ↓
            知识加工层
                   |
       ┌───────────┼───────────┐
       ↓           ↓           ↓
    知识图谱    向量索引    全文索引
       |
       ↓
  AI知识系统
       |
       ↓
  问答 / 分析 / 写作 / 研究

向量检索负责找到信息,结构化知识负责理解信息,两者合起来,才是面向 AI 的知识基础设施。


六、从 RAG 到知识系统,是一次认知变化

回头看这几年,这条路其实拐了三个弯。

一开始我们觉得 AI 缺的是资料,所以建知识库,做 RAG。

后来发现,AI 找到了资料,还是不能稳定地理解。于是又去研究 GraphRAG、知识抽取、结构化知识。

到现在我们越来越觉得,AI 时代真正要紧的,不是存了多少文档,是攒下了多少 AI 能理解的知识。

这就是知识系统。


七、未来竞争的核心,是谁手里有高质量的 AI 上下文

模型能力会越来越强,模型之间也会越来越像。

到那时候真正拉开差距的,大概率是你的 AI 能碰到什么知识。GPT 也好,Claude 也好,大家都能用。

一个干了十年的行业专家为什么比新人强?不是他话说得更好听,是经验、领域知识、判断规则、历史上下文,这些东西他手里都有。

AI 也一样。好的 AI 靠的不只是更大的模型,更是更好的上下文。

知识库就是 AI 的长期记忆。


八、从知识库到 AI 的知识操作系统

我们正在经历一个变化。

知识库以前是给人查东西的,往后是给 AI 提供上下文的。

那它就不再是文件管理系统了,更像 AI 的知识操作系统。理解世界、组织知识、保存事实、建立关系、提供上下文、支撑 AI 创作内容,这些事都归它管。

从 RAG 到结构化知识,从存文档到攒知识,这一步大概就是 AI 应用的下一阶段。

这事还早,我们也还在路上。但方向至少清楚了,先把知识攒对,理解世界是后面的事。

posted @ 2026-09-03 11:00  AI闲人  阅读(8)  评论(0)    收藏  举报