传统 RAG 是 “先检索、后生成” 的线性流程(用户查询→一次性检索外部数据→整合生成答案),而 RIG 采用 “检索与生成实时交错” 模式:
- 用户提交查询后,模型先利用内置知识构建部分响应(如 “可再生能源现在……”);
- 生成过程中若发现信息缺失(如具体利用率数据),即时暂停生成,动态检索外部数据源(如 Data Commons 知识图谱,含 2400 亿 + 权威数据点);
- 检索到数据后继续生成,可多次迭代 “生成 - 检索” 循环,最终输出整合实时数据的完整答案。
- 降低幻觉率:生成中实时补充可靠数据(如回答巴基斯坦卫生进展时,直接嵌入世界银行、WHO 的年份数据),避免依赖过时训练数据;
- 适配小参数模型:无需将所有检索结果塞进 Prompt,对模型上下文长度要求低,小模型也能输出高精度答案;
- 动态补全信息:支持多轮检索,若首次检索数据不全,可自动二次检索,比传统 RAG 的 “一次性检索” 更灵活。
对数据准确性要求高的敏感领域,如金融价格咨询、医疗数据查询、政策进展跟踪(例:回答 “某国卫生目标进展” 时需精准年份数据)。
谷歌开源模型:datagemma-rig-27b-it(适配 Data Commons 知识库,提供 Colab Notebook 快速体验)。
传统 RAG 依赖 “文档切片→向量库检索→Top-K 拼接” 的流程,而 GAG 将 “私有知识” 视为一种 “新模态”,跳过检索环节,直接实现知识表征级注入:
- 领域专家训练:用小模型(如 1.7B 参数)学习私有领域 QA 数据(如免疫佐剂、催化材料专业知识),生成 “领域背景潜码”;
- 单 Token 压缩:通过 2 层 MLP 投影器,将专家潜码压缩为 1 个 4096 维的连续向量(即 “1 个 Token”);
- 底座模型零改动:将该 Token 嵌入冻结的大模型(如 Qwen3-8B)Embedding 空间,模型解码时直接调用注入的私有知识,无需检索向量库。
- 零检索成本:告别文档切片、向量库构建与维护,中小企业无需投入 RAG 系统运维(传统 RAG 年运维成本超 50 万);
- 恒定推理预算:无论私有语料规模多大,推理时仅增加 1 个 Token,比传统 RAG(需拼接 375+Token 检索结果)效率提升 375 倍;
- 不损失通用能力:底座模型全程冻结,注入私有知识后,在公开 QA 基准上性能损失 ±0.5%,而传统 RAG “贴文本到 Prompt” 的方案会暴跌 37%。
企业私有知识注入(如医疗、航空、法律等垂直领域),尤其适合 “无专业运维团队、需快速落地私有 AI” 的场景(例:回答 “AbISCO-300 佐剂能否增强 T 细胞应答” 时,直接调用注入的佐剂机制知识,避免 RAG 的实体错位问题)。
暂不支持多领域知识同时注入(当前一次仅激活 1 个领域),罕见数值 / 单位需外挂轻量后处理模块补充。
传统 RAG 是 “被动响应” 流程,而 Agentic RAG 引入AI 智能体(Agent) 作为核心,构建 “感知 - 决策 - 行动 - 反馈” 闭环:
- 任务规划:智能体先拆解复杂查询(如 “2025 医疗 AI 政策变化”→拆分为 “发布主体 / 监管要求 / 行业影响” 子任务);
- 动态工具调用:根据子任务选择适配工具(向量数据库检索、网络 API、计算器等),而非传统 RAG 的单一检索;
- 反馈优化:检索后评估结果相关性,若召回率低则自动优化查询(如同义词扩展、子查询重构),生成后还可验证答案质量;
- 多代理协同:复杂场景可分专业代理(Web 检索代理、DB 代理、推理代理),协同完成多源信息整合。
- 解决传统 RAG 硬伤:突破 “检索僵化(一次性检索)”“无推理能力(无法多跳拆解)”“适配性差(仅对接单一知识库)” 等问题;
- 支持复杂任务:能处理多跳推理(如 “某产品市场份额变化的原因”)、多模态数据(文档 + 图表 + API 数据)、模糊查询(如 “去年保单慢性病报销条件”);
- 自我验证纠错:生成后自动评估答案准确性,若发现数据矛盾,可二次检索修正(例:传统 RAG 检索到错位文档会 “拒绝回答”,Agentic RAG 可优化查询重新检索)。
企业复杂业务场景,如内部知识管理(多源文档整合)、客户服务(模糊查询精准响应)、研发数据检索(跨语言 / 多模态文档)。
- 框架:LangChain+LangGraph(编排代理流程)、LlamaIndex(多文档代理与图索引);
- 企业案例:某保险集团用 Agentic RAG 升级客服 AI,响应准确率提升 37%,等待时间缩短至 1/3。
- 若需实时精准数据(如政策、医疗)→ 选 RIG(谷歌方案,适配权威知识库);
- 若需低成本注入私有知识(无运维团队)→ 选 GAG(零检索、零底座改动);
- 若需处理复杂业务场景(多跳推理、多工具调用)→ 选 Agentic RAG(智能体驱动)。