RAG Rerank(重排)
RAG 的核心工作原理
一个 RAG( Retrieval-Augmented Generation,简称 RAG, 检索增强生成) 系统的运行闭环主要分为两个阶段:
- 离线数据准备阶段(Indexing):
- 文档解析: 将 PDF、Word、Markdown 等异构文档拆解为结构化文本。
- 智能分块(Chunking): 将长文切分为精细的文本块(Chunk),并结合向量化模型(Embedding)转为高维稠密向量。
- 向量存储: 将向量和原文持久化存储到向量数据库中(如 pgvector、Milvus 等)。
- 在线检索与生成阶段(Inference):
- 用户提问: 用户输入 Query。
- 召回检索: 系统通过 混合检索(Hybrid Search) = 语义向量检索(比如pgvector) + 关键词精准匹配, 通过 RRF(倒数排名融合)从数据库中捞出几十个候选片段。 目标: 确保高召回率,绝不漏掉正确答案。
- 重排(Rerank): 引入重排模型(如 Cohere Rerank、BGE-Reranker)对候选片段深度打分,剔除噪音,精准选出最相关的 Top-N。目标: 极高精度,把噪音全部过滤。
- 增强生成: 将用户问题与精选的干净上下文喂给 LLM,由大模型生成带引用溯源的准确回答。
RAG Rerank(重排)
Rerank(重排)能够让 RAG 系统的精度更高和相关性更高。
RAG(检索增强生成) 系统中,Rerank(重排) 解决了 RAG 中最痛的一个痛点:返回一大堆内容,很多都是不相关的。
或者说,答案找出来了,但排在十几名开外,被一堆无关的噪音淹没,导致大模型看不见或选错。
RAG Rerank 框架选择:
1.商业 API 方案(开箱即用、免运维)
- 代表: Cohere Rerank
- 特点: 顶尖水平,多语言支持极佳,提供现成的 SDK,对 Java/Python 极友好,适合追求开发效率或业务快速验证的团队。
2.开源方案(数据安全、零 API 成本)
- 代表: BGE-Reranker 、Qwen3-Reranker
- 特点: 适合有内网私有化、数据不出海合规要求的企业。通常在服务器(或 GPU 机器)上通过 Python (FastAPI) 封装为一个微服务,供后端(如 Java 项目)通过 HTTP 进行调用。
浙公网安备 33010602011771号