Nebula Graph 在大规模数据量级下的实践和定制化开发

Nebula Graph 在大规模数据量级下的实践和定制化开发

本文作者系微信技术专家李本利

图数据在社交推荐、多跳实时计算、风控和安全等领域有可期待的前景。如何用图数据库高效存储和查询大规模异构图数据,是一个重大挑战。本文描述了5 $ , K K开源分布式图# - 4 P数据库 Nebula Graph 实践中遇到的问题,并通过深度定制,实现:大数据存储、小时级全量导入、多版本控制、b @ q秒级回滚、毫秒级访问等特性。d [ Y [

背景

% a w w大众所熟知的图数据库大多在大数据集合上束手无策,如:Nc 3 X % 4eo4j 的社区版本,采用 Cypher0 u % / D T g 2语言,由单机单副本提H v A U M T v供服务,广泛应用于图谱领域。互联网公司只能在小数据集合下使用,还要解决 Neo4j 多副本一致性容灾的问题。Janu[ f QsGraph 虽然通过外置元/ x _数据管理、kv 存储和索, r T K y引的方式解决了大数据集合存储问题,但其存在广为诟病的性能问题。我们看到大 3 F a q b部分图数据g g s ?库在对比性能时都会提到3 , = K : k和 JanusGraph 相比有几十倍以上的性能提升。

面临大数据量挑战的互联网公司,普遍走向了自研之路,为了贴合业; 1 -务需求,仅支持有限的查{ i o n A [ F询语义。国内主流互联网公司如何解决图数据库的挑战呢:

  • 蚂蚁金服:GeaBase[1]

    金融级图数据库,通过自定义C G 6 r类语言为业务方提供服务,全量计算下推,提供毫秒1 : { 8级延时。主要应用于以下场景:

    • 金融风控场景:万亿级边资金网络,存储实时交易信息,实时欺诈检测。
    • 推荐场景:? n r股票证券推荐。
    • 蚂蚁森林:万亿级的图存储能力,低延时强一致关系数据查询更新。
    • GNN:用于小时级 GNN 训练。尝试动态图 GNN 在线推理。[7]
  • 阿里巴巴:iGraph[2]
    iGraph 是图索引及查询系统,存储用户的行为信息,是阿里数据中台四驾马_ U : @ p s N车之M K J H一。通过 Gremlin 语言为业务R m E `方提供电商图谱实时查询。
  • 今日头条:ByteGraph[3]
    ByteGrq A 8 a c ( vaph 通过在 kv 上增加7 m K K 3统一 cache 层,关系数据拆分为 B+ 树以应对高效的边访x ! ` O p 0 u问和采样,类似 Fa+ ; % T tcebook 的 TAO [6]。
  • ...

架构图

Nebula Graph 在大规模数据量级下的实践和定制化开发

实践

从哪里开始呢?+ e : D Z 6 & n

我们选择从 Nebula Graph[4] 开始我们的图数据库之旅,其吸引我们的有以下几点:

  • 数据集分片,每条边独立存储,超大规模数据集存储潜力。
  • 定制强一致存储引擎,具有计算下推和 MMP 优化的潜力。
  • 创始团队有丰富的图数据库经a ^ g P p验,大数据集合下模型抽象思路经过验证。

实践中的问题

内存爆炸

本质上这是一个性能 VS 资源的问题,数据规模庞大的应用中,内存占用是一个不容忽视的问题。RocksDB 内存由三部分构成:block caK X 5 3 z / uche、index 和 bloom filter、iter pined bM 5 T 4 S D c =lock。

  • block cache 优化@ o z R Q:采用全局{ J F $ m 9 } 0 LRU cache,控制机器上所有 rocksdb 实例的 cach] | b je 占用。
  • bloom filter 优化:一条边被设计为一个 kv 存入到 rocksdb,如果全部 key 保存 bloom filter,每个 key 占用 1- k O : @ @ o C J0bit 空间,那么整个 filter 内存占用远超机器内存。观察到我们大部分的请求模式是获取某一个点的边列表,因此采用 prefix bloom filter;索引到点属性] n F M h O Z这一层实际上即可以对大多数请求进行加速。经过这个优化,单机 filter 所占用内存在 G 这个级别,大多数请求访问速度并未明显降低。

多版本控制

实践中,图数据需要进行快速回滚,定期全量导入,自动访问最新版本数据。我们把数据源大致可以分为两种类型:

  • 周期性数据:比如,按天计算相似用户列表,导入后数据生效。
  • 历史数据+实时数据:比如,历史数据e ` {按天刷新,和实时写入的数据进行合并成为全量数据。

如下是数据在 rocksdbr 6 X k g M 9 的存储模型:

Nebula Graph 在大规模数据量级下的实践和定制化开发

vertex 存储格式

Nebula Graph 在大规模数据量级下的实践和定制化开发

edge 存储格式

其中实时写入的数据 version 记录为时间戳。离线导入的数据h j Q b u versir b L b zon 需要自己指& R D定。我们将该字段和离线导入模块联合使用,用三7 = U I r * : W $个配置项进行版本控制:reserve_versions(需要保留的版本列表)、active_version(用户请求访问到的版本号)、max_version(保留某个版本之后数据,把历史数据和实时写入数据进行合并)。这样可以高效管理离线数据和在线数据,不再使用的数据在下一次 compaction 中被清除出磁盘。

通过这样的方式,业# * ! H % #务代码可以无G a D l d ? # @ 1感更新数据版本,d : m 4 #并做到了秒级回- 3 7 E s滚。

举例:

  • 保留 3 个版本,激活其中一个版本:
alter edge frieng y o z Vd reserve_vU P [ e u aersions = 1 2 3 active_version = 1
  • 数据源为历史数据+实时导入数据。
alter edge friend max_version = 1592147484

快速批量导入

实践中导入大量数据是常规操作,如果不经任何优化,将需要导入的数据转为请, Z w 8 o _ 2求发给图数据库,不仅严重影响线上请求,而且大数据量导入耗时超过一天。对导入速度进行优化迫在眉睫。业界解决f { * u ; Z ! D这个问题一般采用 SST Ingest 方式[5]。我们也是采用类似方式,通过例行调度 spark 任务,离线生成磁盘文件。然后数据节点Z W X拉取自己所需要的数据,并 if W @ / S 6ngest 到数据库中,之后进行版本切换控制请求访问最新版本数据。

整个过程导入速度快,约数个小时内完成全部过程。计算过程主要离线完成,对图R , q 1 I数据库请求影响小。

shared nothing

这是近年X 9 - L * G来老n u ]生常谈的并发加速方式,然而要落地还是考验工程师的编& z D B ? 4 N A B程功底。meta cacho % * G z I 9e 访问频繁,并用 shared_ptr 进行封装,也就成为了原子操作碰撞的高发地。为了能够实现真正的 shared nothing,我们将每一份 meta cache 拷贝为 thread local,具体; u 2 | A $ + 8解决方案请参考该 pull request [8]

小结

图数据库路阻且长,且行且珍惜。如果对于本文有什么疑问,可以在 Gi1 2 G u [ 4 + v ,tHub[9] 上找找。

参考文献

  1. Fu, Zhisong, Zhengwei Wu, Houyi Li, Yize Li, Min Wu, Xiaojie Chen, Xiaomen& } 7 8 ; v hg Ye, Benquan Yu, and Xi Hu. "Gw L / | l 0 ( EeaBase: a high-performance distributed graph database for industry-scale applications." International Journal of High Performance Computing and Networking 15, no. 1-2 (2019): 12-21.
  2. https://mp.weixin.q/ 8 Zq.com/s?__biz=MzU0OTE4MzYzMw==&mid=2247489027&idx=3&snq A ) @ { 3 E=c149ce488cg { O j 0 i a ?fc5231d4273d6da9dc8679&chksm=fbb29ffdccc516ebb8313b92. - ` P q ^ , 5 a02cfd78ea19k l v9da211c55b0ac I Y V P m456a9e632a33e7d5b838d8da8bc6a&mpshare=1&scene=1&srcid=0614MWpeEsM e p iBc1RaBrl4htn3D&sharer_sharetimeE s R o U 0 b n=1592106638907&sharer_shareid=a2497c4756f8bac1bcbef9edf8e _ l # a q O ( c6a86ac&rd2werd=1#wechat_redirect
  3. https://zhuanlan.zhihu.} y 8 K acom/p/109401046
  4. https://giI : ; : V + Lthub.com/vesoft-inc/nebu4 - 0 [ !la
  5. https://www.infoq.cn/article/SPYkxplsq7f36L1Q* ^ + S &ZIz w [Y7
  6. Bronson, Nathan* T U :, Zach Amsden, George Cabrera,7 r p h ! Prasad Cha6 J skka, Peter Dimov, Hui Ding, Jack Ferris et al. "{TAO}: Facebook’s distributed data store for the social graph." In Presented as part of the 2013 {USz ; 6 m x ` eENIX} Annual Technical Conference ({USENIX}{ATC}d J s w % 13), pp. 49J } . F [ P h V-60. 2013.
  7. http://blog.itpub.net/69904796/views! q U Hpace-2653498/
  8. https://github.com/vesoft-inc/nebula/pull/216 Q R q A V U5
  9. https://github.com/xuguruogu/nebula
  10. 腾讯高性能分布式图计算框架柏拉图 https://githu( g r G V w V b.com/Tencent/plato

加入 Nebula GrapT D S S w [ t 2h 交流群,请联系 N0 [ 8 @ s X t 4ebula Graph 官方小助手微信号:NebulaGraphbot