从关键词检索到语义问答:内容系统如何为 AI 检索做好准备
许多内容系统最初围绕关键词检索设计:文章入库时建立标题、标签与正文索引,用户输入词语后,系统根据匹配程度返回链接列表。生成式问答普及后,检索链路多了一层要求——系统不仅要找到相关文档,还要把可靠片段交给模型,让模型在有限上下文中生成可核验的回答。
这类架构通常被概括为“检索增强生成”。它并不是简单地把全文塞进提示词,而是先对内容进行切分和向量化,再根据问题召回若干片段。切分粒度会直接影响效果:片段过长,容易混入无关信息并浪费上下文;片段过短,则可能丢失标题、条件和结论之间的关系。
一种实用做法是按照内容结构切分,而不是只按固定字符数截断。文章标题、章节层级、代码块和列表都可以作为边界,同时为每个片段保留来源地址、更新时间与所属文档。这样,模型生成答案时既能获得完整语义,也能返回可点击的引用,方便用户继续阅读原文。
内容质量同样决定检索上限。如果文档中存在多个互相冲突的版本,向量检索可能同时召回旧规则与新规则。系统应明确文档状态,将过期资料归档,并在索引中加入生效时间、业务范围和权限标签。对于内部知识库,权限过滤必须发生在召回阶段,不能等模型生成答案后再做文本遮盖。
评估也不能只看回答是否流畅。团队可以建立一组真实问题,分别检查召回片段是否相关、引用是否准确、回答是否遗漏条件,以及找不到依据时模型能否明确表示不确定。把检索质量和生成质量分开测量,通常比只对最终回答打分更容易定位问题。
从工程角度看,AI 检索不是替换现有搜索系统,而是在内容治理、索引和权限能力之上增加新的交互层。基础数据越清晰,模型越容易给出稳定答案。与其把全部希望寄托在更大的模型上,不如先让每篇文档具备清楚结构、可靠版本和可追溯来源,这些改进对传统搜索和语义问答都会产生长期价值。
浙公网安备 33010602011771号