HyDE :让 RAG 检索从"匹配关键词"升级到"理解意图"
做过检索增强生成(Retrieval-Augmented Generation,RAG)的人大概都遇到过这样的情况:用户问了一个完全合理的问题,但检索就是漏掉了最相关的信息。
传统 RAG Pipeline 不弱,但它严重依赖查询和文档分块之间的直接相似度匹配。措辞和文档内容只要写法不一样这套就开始失灵。
Hypothetical Document Embeddings(HyDE) 不是"搜索文档",而是让系统在检索开始之前,先想清楚理想答案应该长什么样。
传统检索的问题
大多数 RAG 系统的流程很简单:
Query → Embedding → Vector Search → Retrieved Chunks → LLM Response
向量数据库根据语义相似度去检索,但相似不等于相关。
举个例子:
Query:"How can LangSmith help monitor LLM applications?"
如果存储的分块里从来没出现过 "monitor"、"tracking" 或 "observability",哪怕文档里其实写过答案,检索质量也会掉下来。
由此带来三类典型问题:对未见过的查询检索效果差;在领域专有术语上表现弱;不相关的上下文被送进了 LLM。检索一旦失败,生成基本也跟着崩。
https://avoid.overfit.cn/post/a90afc30978644d58d6dbcf809c457a8

浙公网安备 33010602011771号