HyDE :让 RAG 检索从"匹配关键词"升级到"理解意图"

做过检索增强生成(Retrieval-Augmented Generation,RAG)的人大概都遇到过这样的情况:用户问了一个完全合理的问题,但检索就是漏掉了最相关的信息。

传统 RAG Pipeline 不弱,但它严重依赖查询和文档分块之间的直接相似度匹配。措辞和文档内容只要写法不一样这套就开始失灵。

Hypothetical Document Embeddings(HyDE) 不是"搜索文档",而是让系统在检索开始之前,先想清楚理想答案应该长什么样。

传统检索的问题

大多数 RAG 系统的流程很简单:

  1. Query Embedding Vector Search Retrieved Chunks LLM Response

向量数据库根据语义相似度去检索,但相似不等于相关。

举个例子:

  1. Query:
  2. "How can LangSmith help monitor LLM applications?"

如果存储的分块里从来没出现过 "monitor"、"tracking" 或 "observability",哪怕文档里其实写过答案,检索质量也会掉下来。

由此带来三类典型问题:对未见过的查询检索效果差;在领域专有术语上表现弱;不相关的上下文被送进了 LLM。检索一旦失败,生成基本也跟着崩。

 

https://avoid.overfit.cn/post/a90afc30978644d58d6dbcf809c457a8

posted @ 2026-05-14 22:17  deephub  阅读(15)  评论(0)    收藏  举报