用了 RAG 两年后,我们发现 AI 真正的问题是没知识
两年前我们开始做知识库的时候,第一件事就是把资料全扔进 RAG。
RAG,Retrieval Augmented Generation,检索增强生成,这几年企业做 AI 知识库基本都是从它开始的。路子也很统一,把 PDF、Word、网页资料传上去,系统切分文档,生成向量,存进向量数据库。用户提问,先靠相似度检索捞回来几段相关片段,再交给大模型,答案就出来了。
这条路径快,管用,也撑起了大批 AI 应用落地。
可用了两年,我们慢慢觉得不对劲。
RAG 让 AI 找到了资料,却没让 AI 理解知识。这两件事差得很远。
一、我们曾经也相信 RAG 能解决一切
最初做长文本生成产品,我们选的就是 RAG 路线。想法很朴素,让大模型读着企业资料、行业文档、专业报告,生成像样的内容。
于是我们试了 RAGFlow,也认真研究了 Dify。整条技术链路大概是这样。
原始文档
↓
文档解析
↓
Chunk切分
↓
Embedding向量化
↓
向量数据库
↓
检索相关内容
↓
大模型生成
这套模式确实解决了不少问题。企业制度问答、产品资料查询、内部文档助手、技术资料搜索,这些场景效果都很好。
但场景一旦从问一个问题变成交付一份完整内容,情况就不一样了。
让 AI 根据几十份历史资料写人物传记,对着一堆报告做投资分析,拿地方志整理一个地区的发展史。这类任务一上手,问题就冒出来了。
模型找得到资料。只是这些资料本身,还没变成知识。
二、相关内容不是知识
传统 RAG 的逻辑是,用户提问,系统找出最相关的几个文本片段,交给大模型作答。
听起来没毛病。但对大模型来说,一个 Chunk 只是一次性的上下文输入。这段内容属于哪个实体,这个人物跟哪些事件有关,这个事实出自哪个来源,不同资料之间有没有冲突,哪些内容已经确认,哪些只是猜测,它一概不知。
比如一个历史人物的资料,传统知识库可能是这么存的。
chunk001:
某人在某年担任某职位……
chunk002:
某人在另一个时期参与某事件……
chunk003:
某人的后代情况……
检索到了吗?都检索到了。可这些片段之间没有任何关系。
你想想,模型每回答一次,就得把理解、关联、总结、生成重新走一遍。
也就是说,每调用一次 AI,都在从头整理一次知识。
这才是传统 RAG 最累的地方。
三、AI 时代真正需要的是能被理解的知识
后来我们开始留意另一条路,其中一个启发来自 llm-wiki 这样的项目。
它的思路不一样。文档不是存起来等着被检索,而是让 AI 帮忙,把文档一点点整理成结构化知识。
这个变化很关键。处理链路整个变了。
从
Document
↓
Chunk
↓
Vector
↓
Search
变成
Document
↓
Knowledge Extraction
↓
Entity
↓
Relationship
↓
Concept
↓
Source
↓
Knowledge
一句话,以前的知识库存的是资料,往后的知识库存的是知识。
四、未来的知识库是给 AI 用的
过去几十年的知识库,都是给人用的。
拿企业文档管理系统来说,它解决的是员工去哪找文件这件事。所以核心能力就是分类、搜索、权限、文件管理,全是围着人转的。
到了 AI 时代,要求变了。光让人找到资料不够,还得让大模型能长期理解这些资料。
知识库要提供的东西就不一样了。
1. 知识对象
人物是人物,事件是事件,概念是概念,每一类都有固定结构。
人物
姓名
出生时间
经历
关系
作品
事件
时间
地点
参与者
影响
来源
概念
定义
上下文
关联知识
2. 知识关系
AI 不该只知道王某出现在三个文档里,它该知道王某参与了什么事件,这个事件又影响了什么变化。
王某
|
|参与
↓
某历史事件
|
|影响
↓
某制度变化
关系让知识产生价值。
3. 知识来源和可信度
未来 AI 最头疼的问题会是可信。生成能力已经够用了,难的是说出来的东西有人信。
一个知识系统应该答得上来这些问题,这个结论从哪来的,有几个来源支撑,有没有不同观点,上次更新是什么时候。
所以 Source、Claim、Version、Evidence 这几个概念,我们觉得未来知识库里少不了。
五、RAG 不会消失,它会变成知识系统的一部分
说到这得澄清一个容易误会的地方。
未来不是结构化知识库替代 RAG。RAG 不会消失,它会变成更大知识系统里的一个组件。
以后大概是这样。
原始资料
|
↓
知识加工层
|
┌───────────┼───────────┐
↓ ↓ ↓
知识图谱 向量索引 全文索引
|
↓
AI知识系统
|
↓
问答 / 分析 / 写作 / 研究
向量检索负责找到信息,结构化知识负责理解信息,两者合起来,才是面向 AI 的知识基础设施。
六、从 RAG 到知识系统,是一次认知变化
回头看这几年,这条路其实拐了三个弯。
一开始我们觉得 AI 缺的是资料,所以建知识库,做 RAG。
后来发现,AI 找到了资料,还是不能稳定地理解。于是又去研究 GraphRAG、知识抽取、结构化知识。
到现在我们越来越觉得,AI 时代真正要紧的,不是存了多少文档,是攒下了多少 AI 能理解的知识。
这就是知识系统。
七、未来竞争的核心,是谁手里有高质量的 AI 上下文
模型能力会越来越强,模型之间也会越来越像。
到那时候真正拉开差距的,大概率是你的 AI 能碰到什么知识。GPT 也好,Claude 也好,大家都能用。
一个干了十年的行业专家为什么比新人强?不是他话说得更好听,是经验、领域知识、判断规则、历史上下文,这些东西他手里都有。
AI 也一样。好的 AI 靠的不只是更大的模型,更是更好的上下文。
知识库就是 AI 的长期记忆。
八、从知识库到 AI 的知识操作系统
我们正在经历一个变化。
知识库以前是给人查东西的,往后是给 AI 提供上下文的。
那它就不再是文件管理系统了,更像 AI 的知识操作系统。理解世界、组织知识、保存事实、建立关系、提供上下文、支撑 AI 创作内容,这些事都归它管。
从 RAG 到结构化知识,从存文档到攒知识,这一步大概就是 AI 应用的下一阶段。
这事还早,我们也还在路上。但方向至少清楚了,先把知识攒对,理解世界是后面的事。
浙公网安备 33010602011771号