RAG
RAG(Retrieval-Augmented Generation,检索增强生成)
RAG 是一种将外部证据引入生成过程,并通过检索、重排、引用、拒答和评测机制约束模型输出的 AI 应用架构。它不是简单的"给 AI 接一个知识库",而是一套完整的证据链系统。
核心哲学
RAG 的核心转变:
从"让模型知道更多" → 让模型的回答有证据、有边界、可追溯、可评测
从"能回答" → "可验证"
从"看起来对" → "有证据、可追溯、可验证"
证据链架构
一条完整的 RAG 证据链包含 14 个组件,每个组件解决一个特定问题:
原始文档 (Document)
↓ 清洗/解析
Chunking(切成证据单元)
↓
Embedding(变成语义坐标)
↓
Vector Search + BM25(双路召回)
↓
RRF(融合排序)
↓
Reranker(候选证据复核)
↓
Final Evidence(最终上下文)
↓
LLM 基于证据生成回答
↓
Citation + Faithfulness(引用 + 忠实性检查)
↓
Abstention(证据不足时拒答)
↓
RAG Eval(质量证明)
关键组件
检索层
- [[Embedding]] — 将文本转化为向量,计算语义相似度
- [[Chunking]] — 将文档切成可检索、可引用、可验证的"证据单元"
- [[向量数据库]] — 存储向量并支持相似度检索
- [[BM25]] — 关键词检索,弥补 Embedding 在精确命中上的不足
排序与筛选层
- Hybrid Search — 向量检索 + 关键词检索双路召回
- RRF(倒数排名融合) — 融合多路检索结果,基于排名而非分数
- [[Reranker]] — 对候选 chunk 逐条判断是否真的能回答问题
- Metadata Filter — 限定检索范围(版本、语言、权限、业务线)
- Tenant Filter — 多租户数据隔离
生成与验证层
- topK — 控制候选证据数量,平衡漏召回与噪声污染
- Similarity Threshold — 相似度及格线过滤低质量候选
- Citation — 答案来源追溯标记
- Faithfulness / Groundedness — 检查答案是否忠于证据
- Abstention — 证据不足时拒答
评测层
- RAG Eval — 覆盖 retrieval recall、context precision、faithfulness、answer relevance、citation accuracy、abstention accuracy 的多维度评测
关键原则
1. Embedding ≠ 全部
Embedding 解决语义相似,不等于事实正确。需要 BM25 / 关键词检索互补。
2. 有引用 ≠ 可信
Citation 只说明答案有来源,Faithfulness 才检查来源是否支持答案。
3. 多路召回 + 精排
检索阶段:取 top50(多召回,少遗漏)
重排阶段:取 top3~5(精筛选,少噪声)
4. 边界控制
RAG 不是在全部文档中找最相似的内容,而是在正确范围(版本、权限、租户)里找能支撑答案的证据。
5. 没有 Eval 就没有 RAG
RAG 是多环节链路,任何一环出问题都会导致最终答案出错。必须通过系统评测定位问题环节。
与 AI 幻觉的关系
RAG 是应对 [[AI幻觉]] 的核心技术方案之一。通过在生成过程中引入外部可验证的证据,RAG 约束模型必须基于事实回答,从而显著降低幻觉风险。但 RAG 本身也引入了新的问题维度(检索不准确、引用不匹配、证据不足时错误回答),而这些正是 RAG 架构各组件要解决的问题。
关联连接
- [[AI幻觉]] — RAG 要解决的核心问题
- [[Embedding]] — 语义检索基础
- [[Chunking]] — 证据单元设计
- [[向量数据库]] — 语义检索工具
- [[BM25]] — 互补的关键词检索
- [[Reranker]] — 证据精排

浙公网安备 33010602011771号