RAG Rerank(重排)

RAG 的核心工作原理

一个 RAG( Retrieval-Augmented Generation,简称 RAG, 检索增强生成) 系统的运行闭环主要分为两个阶段:

  1. 离线数据准备阶段(Indexing):
    • 文档解析: 将 PDF、Word、Markdown 等异构文档拆解为结构化文本。
    • 智能分块(Chunking): 将长文切分为精细的文本块(Chunk),并结合向量化模型(Embedding)转为高维稠密向量。
    • 向量存储: 将向量和原文持久化存储到向量数据库中(如 pgvector、Milvus 等)。
  2. 在线检索与生成阶段(Inference):
    • 用户提问: 用户输入 Query。
    • 召回检索: 系统通过 混合检索(Hybrid Search) = 语义向量检索(比如pgvector) + 关键词精准匹配, 通过 RRF(倒数排名融合)从数据库中捞出几十个候选片段。 目标: 确保高召回率,绝不漏掉正确答案。
    • 重排(Rerank): 引入重排模型(如 Cohere Rerank、BGE-Reranker)对候选片段深度打分,剔除噪音,精准选出最相关的 Top-N。目标: 极高精度,把噪音全部过滤。
    • 增强生成: 将用户问题与精选的干净上下文喂给 LLM,由大模型生成带引用溯源的准确回答。

RAG Rerank(重排)

Rerank(重排)能够让 RAG 系统的精度更高和相关性更高。

RAG(检索增强生成) 系统中,Rerank(重排) 解决了 RAG 中最痛的一个痛点:返回一大堆内容,很多都是不相关的。

或者说,答案找出来了,但排在十几名开外,被一堆无关的噪音淹没,导致大模型看不见或选错。

RAG Rerank 框架选择:

1.商业 API 方案(开箱即用、免运维)

  • 代表: Cohere Rerank
  • 特点: 顶尖水平,多语言支持极佳,提供现成的 SDK,对 Java/Python 极友好,适合追求开发效率或业务快速验证的团队。

2.开源方案(数据安全、零 API 成本)

  • 代表: BGE-Reranker 、Qwen3-Reranker
  • 特点: 适合有内网私有化、数据不出海合规要求的企业。通常在服务器(或 GPU 机器)上通过 Python (FastAPI) 封装为一个微服务,供后端(如 Java 项目)通过 HTTP 进行调用。

参考资料:

https://www.callmissed.com/blog/rag-best-practices-2026

posted on 2026-08-13 17:28  乐之者v  阅读(4)  评论(0)    收藏  举报

导航