插件上新 | 让企业文档真正成为 AI 数据,DolphinDB 补齐 RAG 数据链路

AI 应用正在从简单的问答,逐渐走向知识检索、数据分析和复杂任务处理。与此同时,企业中的数据也越来越多地以文档、文本等非结构化形式存在。

如何让这些内容进入数据处理流程,并进一步被模型理解和利用?

DolphinDB 新增 DocParser 与 ModelInference 两款插件,为这一过程补上了新的能力环节。

DocParser  负责文档解析,ModelInference 负责模型推理与向量化。两者结合,可以进一步打通从文档到数据、从数据到模型的处理链路。

点击插件市场,即可下载插件试用。

DocParser:先让 AI 读懂企业里的文档

企业知识并不只存在于数据库。研究报告、产品手册、业务制度、项目方案……大量信息仍然以 PDF、Word、PPT、Excel、TXT 等文档形式存在。要让这些内容真正被 AI 利用,首先需要解决的并不是“怎么问”,而是怎么把文档中的内容可靠地提取出来

这正是 DocParser 所解决的问题。DocParser 支持解析 PDF、DOCX、PPTX、XLSX、TXT 等常见文档格式,将原始文档转换为后续数据处理和 AI 应用可以使用的内容。对于 RAG 场景而言,这意味着原本散落在各种文件中的企业知识,可以先被转换成后续检索流程能够处理的数据。

ModelInference:让模型推理进入数据处理链路

在 RAG 场景下,文档解析只是第一步。接下来,还需要让这些文本具备可以被机器进行语义比较和检索的向量表示

为此,我们同步推出了 ModelInference 插件。作为 DolphinDB 的模型推理插件,ModelInference 将模型推理能力引入数据处理流程。当前版本重点支持 embedding 能力,可以直接将文本转换为 FLOAT 类型的向量表示,为后续的向量存储、相似度检索、召回和排序提供基础。基于这一能力,ModelInference 可以进一步服务于语义检索、知识库、RAG 等 AI 应用。未来,ModelInference 还将支持时序预测等更多模型推理任务。

两款插件,刚好串起一条 RAG 数据链路

DocParser 和 ModelInference 解决的是前后衔接的两个问题:

  • DocParser:把文档变成可处理的数据。
  • ModelInference:把文本转换为可计算的向量。

在实际的 RAG 场景中,可以先使用 DocParser 插件解析 PDF、Word、PPT、Excel 等文档,再利用 DolphinDB 的数据处理能力对解析后的内容进行清洗、整理和加工,随后调用 ModelInference 插件完成文本向量化。生成的向量可以进一步写入 DolphinDB 的 VectorDB 里,利用向量索引进行相似度检索、召回和排序;与此同时,原始文本及相关元数据也可以保存在 DolphinDB 的 TextDB 中,根据具体场景进行全文检索或其他数据处理。

由此,从文档解析、文本处理,到向量化、存储与检索,DolphinDB 可以为 RAG 等 AI 应用提供完整的数据基础。

DolphinDB 的 AI 能力还在持续…

这也是 DolphinDB AI 能力持续演进的一个缩影:从内置的分布式机器学习算子库,到 SVM、XGBoost 插件拓展,进而通过 LibTorch 和 AI Dataloader 对接外部深度学习框架,再到 DolphinMind 智能问答、DolphinX Agent 开发与治理,DolphinDB 的 AI 能力正在从模型计算逐步延伸到数据、知识与业务应用。

此次 DocParser 与 ModelInference 的加入,则进一步补齐了 AI 数据处理与模型推理的基础能力,让 DolphinDB 不仅能够处理结构化数据,也能够更好地连接文档、知识与模型,为企业构建更加完整的数据智能基础。

posted @ 2026-09-18 15:33  DolphinDB  阅读(13)  评论(0)    收藏  举报