封绝的世界

RAG

RAG(Retrieval-Augmented Generation,检索增强生成)

RAG 是一种将外部证据引入生成过程,并通过检索、重排、引用、拒答和评测机制约束模型输出的 AI 应用架构。它不是简单的"给 AI 接一个知识库",而是一套完整的证据链系统

核心哲学

RAG 的核心转变:

从"让模型知道更多"      → 让模型的回答有证据、有边界、可追溯、可评测
从"能回答"              → "可验证"
从"看起来对"            → "有证据、可追溯、可验证"

证据链架构

一条完整的 RAG 证据链包含 14 个组件,每个组件解决一个特定问题:

原始文档 (Document)
  ↓ 清洗/解析
Chunking(切成证据单元)
  ↓
Embedding(变成语义坐标)
  ↓
Vector Search + BM25(双路召回)
  ↓
RRF(融合排序)
  ↓
Reranker(候选证据复核)
  ↓
Final Evidence(最终上下文)
  ↓
LLM 基于证据生成回答
  ↓
Citation + Faithfulness(引用 + 忠实性检查)
  ↓
Abstention(证据不足时拒答)
  ↓
RAG Eval(质量证明)

关键组件

检索层

  • [[Embedding]] — 将文本转化为向量,计算语义相似度
  • [[Chunking]] — 将文档切成可检索、可引用、可验证的"证据单元"
  • [[向量数据库]] — 存储向量并支持相似度检索
  • [[BM25]] — 关键词检索,弥补 Embedding 在精确命中上的不足

排序与筛选层

  • Hybrid Search — 向量检索 + 关键词检索双路召回
  • RRF(倒数排名融合) — 融合多路检索结果,基于排名而非分数
  • [[Reranker]] — 对候选 chunk 逐条判断是否真的能回答问题
  • Metadata Filter — 限定检索范围(版本、语言、权限、业务线)
  • Tenant Filter — 多租户数据隔离

生成与验证层

  • topK — 控制候选证据数量,平衡漏召回与噪声污染
  • Similarity Threshold — 相似度及格线过滤低质量候选
  • Citation — 答案来源追溯标记
  • Faithfulness / Groundedness — 检查答案是否忠于证据
  • Abstention — 证据不足时拒答

评测层

  • RAG Eval — 覆盖 retrieval recall、context precision、faithfulness、answer relevance、citation accuracy、abstention accuracy 的多维度评测

关键原则

1. Embedding ≠ 全部

Embedding 解决语义相似,不等于事实正确。需要 BM25 / 关键词检索互补。

2. 有引用 ≠ 可信

Citation 只说明答案有来源,Faithfulness 才检查来源是否支持答案。

3. 多路召回 + 精排

检索阶段:取 top50(多召回,少遗漏)
重排阶段:取 top3~5(精筛选,少噪声)

4. 边界控制

RAG 不是在全部文档中找最相似的内容,而是在正确范围(版本、权限、租户)里找能支撑答案的证据。

5. 没有 Eval 就没有 RAG

RAG 是多环节链路,任何一环出问题都会导致最终答案出错。必须通过系统评测定位问题环节。

与 AI 幻觉的关系

RAG 是应对 [[AI幻觉]] 的核心技术方案之一。通过在生成过程中引入外部可验证的证据,RAG 约束模型必须基于事实回答,从而显著降低幻觉风险。但 RAG 本身也引入了新的问题维度(检索不准确、引用不匹配、证据不足时错误回答),而这些正是 RAG 架构各组件要解决的问题。

关联连接

  • [[AI幻觉]] — RAG 要解决的核心问题
  • [[Embedding]] — 语义检索基础
  • [[Chunking]] — 证据单元设计
  • [[向量数据库]] — 语义检索工具
  • [[BM25]] — 互补的关键词检索
  • [[Reranker]] — 证据精排
posted @ 2026-06-30 18:06  天边的云云  阅读(16)  评论(0)    收藏  举报