面向AIGC的检索增强生成综述
原文:https://mp.weixin.qq.com/s/Z3355OEqzJBQvqXONxgO0g
RAG往期文章推荐
收藏!RAG核心工具大全: 7大解析工具+向量模型+数据库+检索排序
GraphRAG开源生态全景:6大主流开源项目,微软/蚂蚁/港大项目同台PK
企业级落地方案:Docker 部署 CodeGraph 多项目统一 MCP 网关,附源码
一文搞定Gerrit/Gitee/GitHub MCP Server,实现开发全流程自动化
标题: Retrieval-Augmented Generation for AI-Generated Content: A Survey
链接:https://link.springer.com/content/pdf/10.1007/s41019-025-00335-5.pdf
github: https://github.com/hymie122/RAG-Survey
这篇论文系统性地综述了检索增强生成(RAG)在AIGC中的应用,涵盖了RAG的基础范式、增强方法、跨模态应用、评估基准、局限性及未来方向。
1. 背景与动机
在算力、数据(高质量海量数据)和算法(从百万级到万亿级参数)三驾马车的驱动下,AIGC已在文本、代码、图像、视频等模态上取得巨大成功。但仍面临知识过时、长尾知识不足、训练推理成本高、数据泄露风险等问题。
RAG 的核心思想是把外部数据存储当作非参数化记忆:检索到的知识易于更新、能容纳大量长尾知识、可存放机密数据,同时还能减小模型规模、支持长上下文、加速推理。
不同于已有的综述论文只聚焦 LLM 文本场景的 query-based RAG,论文覆盖基础范式—增强技术—跨模态应用—评测基准—局限与展望全链条。
2. 预备知识

通用 RAG 架构(两个核心模块):检索器接收查询并从数据存储中搜索相关信息,原始查询与检索结果通过某种增强方式送入生成器,生成器最终产出内容。
四类主流生成模型:
-
Transformer:自注意力 + 前馈网络,每步做词表分类输出;
-
LSTM:带门控机制的循环网络,缓解长程依赖的梯度问题;
-
扩散模型(Diffusion/LDM):先加噪再逆向去噪生成,适用于图像、音频、分子等;
-
GAN:生成器与判别器对抗训练。
检索器分类:
-
稀疏检索:基于词项匹配统计(TF-IDF、BM25、查询似然),构建倒排索引;
-
稠密检索:用 BERT 类模型将查询和键编码为稠密向量(即 DPR, Dense Passage Retrieval),用余弦/内积等度量相似度,训练时用对比学习 + 负样本,推理时用 ANN 索引(HNSW、DiskANN、SPANN 等)加速;
-
其他检索:编辑距离、代码 AST 距离、知识图谱 k 跳邻域搜索、命名实体识别(NER)等。
3. RAG 基础范式(全文核心分类)

按检索信息如何作用于生成器分为 4 大类:
(1) Query-based RAG(查询增强)
-
原理:检索内容与原始查询拼接后直接作为生成器输入(提示词增强)
-
代表工作:REALM(双 BERT 架构)、Lewis et al.(DPR + BART)、REPLUG(把 LLM 当黑盒)、In-Context RALM;图像领域 RetrieveGAN、IC-GAN;3D 领域 RetDream 等
-
特点:模块化、即插即用、部署快,提示词设计是关键
(2) Latent Representation-based RAG(隐表征增强)
-
原理:检索结果编码为隐向量,在模型中间层(注意力、交叉注意力)融合
-
代表工作:FiD(每个检索段落独立编码、融合后由单一解码器生成)和 RETRO(分块交叉注意力 CCA 融合检索内容);还有 Unlimiformer(Transformer 块内集成 kNN 突破上下文长度)等。图像领域用交叉注意力融合,3D 动作生成 ReMoDiffuse/AMD,音频 Re-AudioLDM,视频字幕 R-ConvED/CARE 等。
-
特点:适配面广、融合深,但需要额外训练对齐隐空间。
(3)Logit-based RAG(对数概率增强)
-
原理:在解码阶段,把检索得到的分布与模型原生 logit 做加权融合
-
代表工作:kNN-LM 及其变体、TRIME、NPM(用非参数数据分布替代 softmax,长尾场景效果显著);代码领域 RECODE、kNN-TRANX,图像描述 MA
-
特点:适合序列生成,生成器与检索在概率层面解耦
(4)Speculative RAG(推测式增强)
-
原理:用检索直接替代部分生成步骤,节省资源、加速响应。
-
代表工作:REST(用检索替代投机解码中的小模型生成草稿)、GPTCache(语义缓存)、COG(把生成分解为"复制粘贴"操作)。
-
特点:主要适用于序列类数据
4. RAG 增强方法

论文把工程优化分成五大方向:输入增强、检索器增强、生成器增强、结果增强、全流水线增强
(1)输入增强
-
查询变换:HyDE、Query2doc 生成伪文档、复杂查询拆解子查询
-
数据增强:清洗、扩充知识库素材
(2)检索器增强
-
递归检索(ReACT、RATP 用 MCTS)
-
分块优化(small-to-big、RAPTOR 多层树)
-
检索器微调(REPLUG、SYNCHROMESH)
-
混合检索(稀疏+稠密,Rencos、CRAG)
-
重排序(Re2G、monoT5)
-
检索内容变换(FILCO 去噪、FiD-Light 压缩)
(3)生成增强
-
提示工程(LLMLingua 压缩、Stepback/CoT 提示)
-
解码调优(温度、词表约束)
-
生成器微调(RETRO、LoRA 适配如 Animate-A-Story)
(4)结果增强
- 输出改写/重排(SARGAM、Ring、CBR-KBQA)
(5)管线增强
-
自适应检索:判断要不要检索,不需要的时候跳过检索,减少开销;分为规则驱动(FLARE、SKR、Self-RAG)、模型驱动(Self‑RAG)
-
迭代 RAG:多轮 检索‑生成 循环,反复补全缺失知识,提升复杂任务性能
5. 跨模态应用综述

论文用一张大表按 模态 × 任务 × 所用范式 × 增强环节 系统梳理了约 200 项工作:
-
文本:问答(REALM、FiD、RETRO、TOG、Atlas)、事实核验(CONCRETE)、常识推理(KG-BART)、人机对话(BlenderBot3、ConceptFlow)、机器翻译(kNN-MT、TRIME)、事件抽取、摘要(Unlimiformer、RPRR)等 7 类任务
-
代码:代码生成(APICoder、DocPrompting)、代码摘要(Rencos、EditSum)、代码补全(ReACC、RepoCoder)、自动程序修复(InferFix、RAP-Gen)、Text-to-SQL(XRICL、SYNCHROMESH)等——代码领域特色是用 AST/编辑距离检索、检索相似样例填提示词
-
知识:知识库问答(ReTraCk、TIARA、CBR-KBQA)、知识增强开放域问答(UniK-QA、KG-FiD)、表格问答(EfficientQA、StructGPT)
-
图像:生成(RetrieveGAN、Re-Imagen、KNN-Diffusion、RDM)与描述(RA-Transformer、SmallCap、REVEAL)
-
视频:视频描述(R-ConvED、CARE、EgoInstructor)、视频问答对话(MA-DRNN、R2A)、故事生成(Animate-A-Story)
-
音频:Re-AudioLDM、Make-An-Audio、RECAP
-
3D:ReMoDiffuse、AMD、RetDream(文生动作/三维)
-
科学:药物发现(RetMol、PromptDiff)、生物医学(PoET、Chat-Orthopedist、BIOREADER)、数学(LeanDojo 定理证明)
6. 评测基准
| 基准 | 评估维度 |
| Chen et al. | 噪声鲁棒性、负例拒绝、信息整合、反事实鲁棒性 |
| RAGAS, ARES, TruLens | 忠实度、答案相关性、上下文相关性 |
| CRUD-RAG | 创建、读取、更新、删除 |
| MIRAGE | 医学问答 |
| KILT | 知识密集型任务 |
| CRAG, Multihop-RAG, Legalbench-RAG, OmniEval | 多领域、多任务评估 |
论文梳理了 5 个主流 RAG 基准:RGB、CRUD-RAG(中文综合基准)、ARES(自动化评估框架)、RAGAS(自动化评测)、KILT(知识密集型任务基准)。同时也指出基准建设仍不充分,尤其在非文本模态。
7. 局限性与未来方向
-
长上下文 vs. RAG:长上下文 LLM 的兴起对 RAG 构成挑战,二者如何结合(如用 RAG 选择真正需要的内容再送入长上下文)值得研究
-
鲁棒性:检索噪声、错误信息、对抗性内容会误导生成,导致幻觉
-
效率与延迟:检索、重排、迭代检索带来延迟、存储开销,不利于低延迟实时服务
-
检索器‑生成器鸿沟:两者优化目标、隐空间不一致;联合训练和模块化之间存在取舍

浙公网安备 33010602011771号