RAG基础知识概念
RAG概念和原理
RAG(Retrieval-Augmented Generation)
-
检索增强生成,是一种结合信息检索(Retrieval)和文本生成(Generation)的技术
-
RAG技术通过实时检索相关文档或信息,并将其作为上下文输入到生成模型中,从而提高生成结果的时效性和准确性。
RAG 的优势:
-
解决知识时效性问题:大模型的训练数据通常是静态的,无法涵盖最新信息,而RAG可以检索外部知识库实时更新信息
-
减少模型幻觉:通过引入外部知识,RAG能够减少模型生成虚假或不准确内容的可能性
-
提升专业领域回答质量:RAG能够结合垂直领域的专业知识库,生成更具专业深度的回答
-
生成内容的溯源(可解释性)
RAG的核心原理和流程
RAG 本质上就是重构了一个新的 Prompt
Step1:数据预处理,构建索引库
-
知识库构建:收集并整理文档、网页、数据库等多源数据,构建外部知识库
-
文档分块:将文档切分为适当大小的片段(chunks),以便后续检索。分块策略需要在语义完整性与检索效率之间取得平衡
-
向量化处理:使用嵌入模型(如BGE、M3E、Chinese-Alpaca-2等)将文本块转换为向量,并存储在向量数据库中
Step2:检索阶段
-
查询处理:将用户输入的问题转换为向量,并在向量数据库中进行相似度检索,找到最相关的文本片段
-
重排序:对检索结果进行相关性排序,选择最相关的片段作为生成阶段的输入
Step3:生成阶段
-
上下文组装:将检索到的文本片段与用户问题结合,形成增强的上下文输入
-
生成回答:大语言模型基于增强的上下文生成最终回答
NativeRAG
NativeRAG 检索增强生成(RAG)技术的最基础、最原始的实现范式,是所有高级 RAG 方案的起点。它以最简单的 “索引→检索→生成” 三步流水线完成 “先查资料、再生成答案” 的流程。

核心流程
-
索引构建(Indexing,离线)
-
如何更好的把知识存储起来?
-
把文档(PDF/Word/ 网页等)清洗、提取纯文本。
-
将长文本切分成固定大小的文本块(Chunk)。
-
用嵌入模型(Embedding Model)把每个文本块转为向量(Embedding)。
-
把向量存入向量数据库(如 Chroma、FAISS、Milvus)
-
-
检索(Retrieval,在线)
-
如何在大量知识中,找到一小部分有用的,给模型参考?
-
用户提问 → 用同一嵌入模型把问题转为查询向量。
-
在向量库中做相似度搜索,取出Top-K 最相关的文本块。
-
-
生成(Generation,在线)
-
如何结合用户的提问和检索到的知识,让模型生成有用的答案
-
将用户问题 + 检索到的 Top-K 文本块拼接成提示(Prompt)。
-
送入大语言模型(LLM),让模型基于检索到的上下文生成回答
-


浙公网安备 33010602011771号