【学习笔记】跑出 AI 新能力OceanBase 刷新国际 Data Agent 榜单

近日,OceanBase 团队提交的 Data Agent 方案在国际数据智能体基准 Data Agent Benchmark(简称 DAB)中,以 90.62% 的准确率刷新纪录,成为该榜单中首个准确率达到 90%以上的参评方案。

值得关注的是,这一成绩由 OceanBase 基于国产大模型 GLM-5.2 构建,超过多项基于 GPT、Claude Opus、Claude Fable 等海外模型构建的 Data Agent 方案。本次参评方案内部代号为 Scout,相关能力将融入 OceanBase DataPilot。

OceanBase 团队提交的 Data Agent 方案成 DAB 榜单首个准确率突破 90% 的参评方案

DAB 由 UC Berkeley EPIC Data Lab 与 Hasura PromptQL 合作推出。

评测覆盖互联网/本地生活、金融股票、生物医学、知识产权、企业运营、政务/公共管理、媒体/文娱等多个领域,并涉及 PostgreSQL、MongoDB、SQLite、DuckDB 等多种数据库。

与传统 Text-to-SQL 主要考察 AI 能否将自然语言转换成 SQL 不同,DAB 更关注 AI 进入真实数据环境后,能否从复杂、分散、形态各异的数据中找到正确答案。

一个完整任务中,Data Agent 需要理解数据、选择数据、规划分析路径、完成查询计算,并对结果进行验证,考验的是从“理解数据”到“拿到答案”的完整能力。

也正因此,DAB 考验的不只是底层模型,而是“模型+Agent+数据系统”的综合能力。

模型负责理解和推理,Agent 负责规划和执行,数据系统则要支撑数据发现、关联计算和结果校验。三者能否协同,直接影响AI能不能真正把企业数据用起来。

审视此次 DAB 榜单,全球有多家技术团队参与竞争,为什么 OceanBase 能率先突破 90% 准确率的技术门槛?

答案并不只在于底层大模型的选择,关键在于构建了一套完整的“数据理解—任务执行—结果校验”技术闭环体系,这一体系设计在很大程度上决定了 AI 数据分析的最终效果和可靠性。

  • 在数据理解环节,系统通过 DataLens 机制自动构建数据画像、识别字段语义与关联关系,并结合任务规划和结构化约束,将自然语言需求拆解为数据源与字段选择、筛选条件与关联键确定、跨源关联、聚合排序及结果校验等可执行的分析步骤。

  • 任务执行层面,系统根据任务特点动态匹配执行路径:简单结构化查询直接调用工具,快速响应;多步计算任务走带约束检查的数据工作流,逐步验证;涉及文本理解的任务则结合语义抽取与分类工具协同处理。

  • 结果校验环节,底层由 DataKernel 与语义处理工具协同完成计算,上层通过证据追踪与答案校验,检查计算对象、统计粒度和执行过程是否符合任务要求,并把结果和数据来源关联起来。

系统通过证据追踪与答案校验机制,对计算对象、统计粒度及执行过程进行全面核查,并将最终结果与数据来源显式关联。

一旦发现异常,系统依据结构化诊断定向修改执行计划,在限定预算内完成重新验证与执行,让复杂数据分析更可靠、可追溯,有效避免错误结果输出。

三大环节有机结合,构建了端到端的智能分析闭环。这既是本次评测跑出 90%+ 成绩的关键所在,也充分展示了 OceanBase 在复杂数据分析场景中的体系化落地能力。

此次刷新 DAB 纪录的成果,是 OceanBase 将数据库能力进一步延伸至 AI 数据分析环节的一次验证,也是长期深耕 AI 技术方向、持续推动创新的真实写照。

过去,数据库主要负责存储、查询和处理数据。随着 AI Agent 成为新的数据使用者,数据库需要解决的问题也在变化:AI 不仅要拿到数据,还要理解数据、关联数据、分析数据,并验证结果是否可靠。

AI 时代的数据底座,也因此开始从“把数据交给 AI”,走向“帮助 AI 把数据用起来”。

这正是 OceanBase 从数据库向 AI 数据平台演进的方向。

自今年 6 月 29 日发布湖库一体的 AI 数据库以来,OceanBase 持续推动 AI 时代数据平台的成型,并通过 AI 数据库 和 AI 湖库,加速生产级 AI 应用的价值实现,为新形态 AI 应用创新提供坚实支撑。

其中,平台现有的智能问数产品 OceanBase DataPilot,将把此次评测中的相关能力正式集成并应用落地。

OceanBase DataPilot 是面向经营分析和业务决策的数据智能 Agent。

作为统一的企业业务智能入口,让业务人员可以通过自然语言完成分析报告、数据看板和可信答案生成,把过去依赖专业数据团队完成的分析流程,转化为可交互、可追问、可复用的智能决策能力。同时,内置细粒度数据权限与审计能力,确保数据安全合规。

在本次 DAB 评测中,OceanBase DataPilot 承接了验证过程中的数据理解、任务规划、执行与校验能力。

下一步,相关技术能力将在 OceanBase DataPilot 中沉淀,助力 AI 实现从“调用数据”到“用数据完成任务”的能力跃迁。

评测成绩是技术能力的证据之一,而非终点。生产环境中的可靠性、权限治理、运行成本、响应延迟与跨场景适用性,还需结合产品测试与客户实践持续打磨验证。

但可以明确的是,OceanBase 已经走出了一条具体的路径:将模型能力与数据工程深度融合,以对数据结构、关联关系和计算过程的深度理解为基础,系统性地支撑智能体的任务规划与执行,推动 AI 从“理解用户意图”走向“可靠地完成数据分析”。

这也正是 OceanBase 从数据库向 AI 数据平台演进的核心方向——让数据真正成为企业智能决策的坚实底座。

图片

立即试用 OceanBase 企业版,体验国产数据库能力立即试用 OceanBase 企业版,体验国产数据库能力

posted @ 2026-09-22 14:44  OceanBase数据库  阅读(9)  评论(0)    收藏  举报