准确率首破90%!OceanBase凭硬核架构登顶全球AI数据智能体榜单
突破90%门槛:国产技术站上国际领奖台
在国际AI评测舞台上,一道新的分水岭已经出现。近期发布的数据智能体基准测试(DAB)结果中,OceanBase团队提交的代号为“Scout”的方案,以90.62%的准确率强势拔得头筹,成为该榜单历史上首个跨过90%大关的作品。
令人瞩目的是,这一成绩并非依赖海外主流大模型,而是由国产数据库OceanBase搭配国产大模型GLM-5.2共同驱动。它不仅击败了多项基于GPT、Claude Opus及Claude Fable等海外顶尖模型构建的参评方案,更标志着国产基础软硬件协同作战迈出了关键一步。目前,该项核心能力已启动工程化落地,即将正式融入OceanBase DataPilot产品线,完成从实验室验证到商业化服务的跨越。
不止于“文生SQL”:AI真正进入实战场景
要读懂这个90.62%的分量,得先看清DAB测试的底层逻辑。该基准由UC Berkeley EPIC Data Lab与Hasura PromptQL联合推出,广泛覆盖互联网生活、金融股票、生物医学、政企管理等数十个垂直领域,并打通了PostgreSQL、MongoDB、SQLite、DuckDB等多元数据库环境。
过去我们熟知的Text-to-SQL,大多只考察AI能否将自然语言翻译成可执行的SQL语句,本质上仍是“纸面翻译”。而真实的商业数据场景往往是杂乱且碎片化的:表结构各异、数据孤岛林立、业务口径模糊。DAB模拟的就是这种高难度实战环境——它不考语法转换,考的是AI面对未知复杂体系时的完整解题能力:能否看懂数据结构?能否在多源表中精准定位?能否设计合理的分析路径?算完后能否自我验明正身?这考验的是从“读懂数据”到“交付可信答案”的全链路素养。
“模型+Agent+数据底座”的三维协同
正是这种综合性的挑战,让单一的大模型无法独挑大梁。一场成功的Data Agent任务,本质上是“模型推理大脑 + Agent执行骨架 + 数据系统算力底座”的铁三角协作。模型负责语义理解与逻辑推理,Agent负责任务拆解与流程调度,而数据系统则必须提供坚实的数据探查、关联计算与结果校验支撑。三者能否无缝咬合,直接决定了AI能否真正把企业沉睡的数据盘活。
OceanBase此次突围,靠的是一套精密闭环的系统工程。在内部方案“Scout”中,系统首先借助DataLens模块为庞杂的数据生成清晰画像,快速厘清字段间的隐性关联;随后根据任务复杂度动态规划分析路线,高效完成数据的筛选、聚合与计算;最关键的环节在于结果出炉后的“自查自纠”,通过证据追踪与交叉验证机制严格检验计算链条,一旦察觉偏差立即回滚调整,重新生成最优解。这种“认知规划—执行计算—验证修复”的飞轮效应,大幅拉升了复杂场景下的答案可靠性。
从“存数据”到“用数据”:数据库的新使命
对OceanBase而言,这次登顶DAB不仅仅是一次性能测试的胜利,更是产品演进路线的自我验证。长久以来,传统数据库的定位偏向于冷静的“数据仓库”与“查询引擎”,主要负责安全存储与快速返回结果。
但在AI原生时代,Agent正在取代人类成为数据的主要消费者。它们不再满足于拿到原始报表,而是需要深度理解业务语境、自动关联多源信息、独立完成复杂推演,并对输出结果的准确性负责。这意味着,现代数据底座必须完成一次角色升级:从被动交付数据,转变为主动赋能AI高效使用数据。这也是OceanBase从单一关系型数据库向AI数据平台演进的核心方向。
结语
随着相关技术全面沉淀至DataPilot产品线,OceanBase正在悄然重塑人与数据、AI与系统的交互范式。从数据库向AI数据平台的跃迁,改变的不仅是功能边界,更是整个技术栈的底层逻辑。当国产数据库能够熟练地辅助AI“吃透数据、分析数据、验证数据”,我们便看到了一个从“数据储备池”进化为“AI工作引擎”的未来图景。这一次冲击全球榜首的成绩,或许只是这场静悄悄变革的第一个里程碑。