大模型正在改变企业使用数据的方式。过去,业务系统主要通过预先定义的报表、接口和查询条件访问数据;现今,越来越多的用户习惯直接用自然语言提出问题。随着问题变得愈加开放,检索系统所面对的也不再只是关键词匹配或相似内容召回。
企业中的数据往往存在复杂而明确的联系。一笔交易关联客户、账户和设备,一份合同涉及企业、项目与责任人,一次风险事件也可能沿着资金、人员和组织关系不断延伸。很多问题只有把这些关系串联起来,才能还原完整的业务背景。系统既要找到相关信息,也要继续判断这些信息与谁有关、经过哪些路径相连,以及结论背后有哪些可以核验的数据依据。
图检索能力由此进入企业 AI 的数据处理链路。它将业务对象以及对象之间的联系组织为节点、边和路径,使关系能够被直接查询和计算,为关联分析、多跳检索、路径发现和结果解释提供数据基础。
随着 AI 的不断发展,向量检索逐渐成为大模型应用连接外部知识的重要方式。它擅长从大量文本、图片以及其他非结构化内容中,找出语义上接近的对象。但在真实业务场景中,"相似"往往只是第一步。一次业务查询,可能会同时涉及业务约束、结构化数据关联、关键词匹配、语义召回和关系追踪。例如,在风险排查中,系统不仅要找到与某段风险描述相似的文档,还要继续确认相关账户、交易、设备和人员之间是否存在多跳联系;在知识问答中,系统不仅要召回包含某个概念的材料,还要辨别概念之间的上下位、依赖、引用与因果关系。
单纯依赖向量检索,仅仅可以回答"哪些内容更相似";而图能力则将实体及其关系组织为可查询、可计算的数据结构,更适合回答"对象之间如何关联"。节点、边、标签和路径将隐含在表连接、文档叙述和业务规则中的关系显式表达出来,使检索结果能够沿着具体的业务路径被追溯和验证。在此基础上,系统可以执行模式匹配、邻接扩展、可变长度遍历、最短路径、环检测和路径计数等图查询。

对于需要多跳证据、关联分析和结果解释的 AI 应用,图能力提供了一种更加贴近企业数据特点的实现方式:关系能够被查询,路径能够被验证,结论也能够找到对应的数据依据。
近年来,GraphRAG 等技术实践进一步推动了关系检索进入工程视野。面对跨文档、跨实体和全局性问题,仅按文本块进行相似度召回,很难保留完整的关系上下文。企业将关系检索应用于实际业务时,还需要数据库提供可靠的关系存储、高效的路径遍历、持续的数据更新和完善的权限控制。
CittaBase 是四维纵横面向 AI 混合负载场景推出的一栈式融合数据库。面向 AI 的业务系统,数据访问往往贯穿一条完整链路:既要处理业务状态读写和事务操作,也要查询结构化事实、检索知识内容、追踪实体关系,并对相关数据进行分析。围绕这类需求,CittaBase 以 PostgreSQL 兼容的数据与事务底座为基础,在同一数据库实例中提供 OLTP、OLAP、Cypher 图查询、BM25 全文检索和向量检索能力。基于这一能力组合,CittaBase 可用于建设本体数据基座、企业经营操作系统数据基座和 RAG 知识库等场景,在同一数据库实例内统一承载业务状态读写、知识检索、关系查询与 OLAP 分析,减少多套系统之间的数据同步、权限维护和结果拼接。
CittaBase 原生内置图检索与图计算能力,通过统一的数据访问入口处理结构化数据和关系数据,支持模式匹配、可变长度路径、多跳遍历、最短路径、全部最短路径、关系标签组合、多标签读取、路径计数和环检测等图查询。图查询结果还可以继续参与 SQL 过滤、连接与聚合,让关系路径和业务属性在一次查询中共同参与计算。

围绕图查询的执行效率,CittaBase 对多类典型查询进行了针对性优化。对于有界可变长度路径、路径计数、固定端点和部分最短路径查询,系统可以采用计划改写、索引访问和专用执行路径,减少无效遍历及完整路径物化。CittaBase 还提供图计算加速能力,通过可达性判断提前剪除无效分支,并加速部分路径计算与图算法。
此外,企业图数据通常还包含大量属性,并与明细表、时间序列、文档、日志和向量特征共同使用。CittaBase 的向量化执行引擎通过批量化处理和算子优化,可以显著提高数据扫描、过滤、连接、聚合及复杂分析查询的整体执行效率,为图数据的属性计算、候选集筛选和后续分析提供高吞吐的执行基础。
图查询的性能表现与查询形态密切相关,单一场景很难反映图引擎的整体能力。为了覆盖更具代表性的查询类型,此次测试采用 GraphBench 的 B 类基础场景和 C 类复杂场景,共 38 条查询,涵盖主键点查、属性过滤、邻接扩展、多跳遍历、最短路径、环检测和路径计数等典型负载。
测试按照固定顺序执行,每条查询运行 3 次,对比 Neo4j 与 CittaBase 的冷态执行时间。结合总耗时、单项结果和不同查询类型的表现,可以观察 CittaBase 图引擎在不同负载下的执行特点。

具体测试结果明细如下:

测试口径:B 类基础场景 20 条、C 类复杂场景 18 条,共 38 条;先执行 base.sql,再执行 complex.sql。比值为 CittaBase cold ÷ Neo4j cold,数值越低表示本轮耗时越短。测试口径:B 类基础场景 20 条、C 类复杂场景 18 条,共 38 条;先执行 base.sql,再执行 complex.sql。比值为 CittaBase cold ÷ Neo4j cold,数值越低表示本轮耗时越短。
从总耗时看,CittaBase 为 129.205 秒,Neo4j 为 1023.328 秒,前者约为后者的 13%。这项总成绩受到 C18 的显著影响:在"有向 7-hop 原始路径计数"中,Neo4j 单条耗时 872.679 秒,CittaBase 为 0.374 秒。剔除 C18 后,剩余 37 条查询分别为 150.649 秒和 128.831 秒,两者处于接近量级,CittaBase 在本轮 workload 下仍略快。
从查询类型看,CittaBase 在高选择性点查、固定起点或终点的邻接计数、时间范围过滤、部分文本过滤、最短路径、有限深度路径枚举和若干复杂图模式上表现较好;在全图节点与边计数、低选择性 IN 过滤、标签聚合以及 7-hop endpoint 逐层去重等场景中,仍有进一步优化空间。
38 条查询覆盖了从主键点查、局部关系扩展到复杂路径计算的多类负载。测试结果显示,CittaBase 原生图引擎已经具备较完整的查询覆盖能力;在部分深路径计数场景中,矩阵剪枝和计数快速路径明显减少了无效遍历与路径物化,性能提升较为明显。
自然语言正在成为新的数据访问入口,企业查询也开始同时涉及结构化条件、文本内容和实体关系。图能力可以把分散在表关联、业务规则和文档描述中的联系组织起来,让系统直接查询关联对象、追踪业务路径,并为查询结果提供可以核验的数据依据。
围绕这类需求,CittaBase 将 OLTP、OLAP、原生图查询、图计算加速、BM25 全文检索、向量检索和向量化执行整合在同一数据库实例中。企业可以在一套数据与权限体系内完成候选召回、关系扩展和结果分析,帮助企业减少跨系统的数据同步与结果拼接,更高效地完成关系检索和混合分析。
推荐阅读