LinkedIn的LIquid图数据库:为9.3亿+会员扩展实时数据访问

LinkedIn 的 LIquid 图数据库及其应用

LinkedIn 最近发布了其图数据库 LIquid 如何自动索引和实时访问所有与成员、学校、技能、公司、职位、工作、事件等相关的连接。这一知识图谱被称为“经济图谱”,拥有 2700 亿条边且不断增长,目前每秒处理 200 万次查询。

从 GAIA 到 LIquid 的迁移

LinkedIn 将其“可能认识的人”(PYMK)推荐系统从遗留的 GAIA 系统迁移到 LIquid。这一迁移显著提高了每秒查询数(QPS)、降低了延迟并优化了 CPU 利用率。QPS 从 120 增加到 18000,延迟从超过 1 秒降至平均 50 毫秒以下,CPU 利用率降低了超过 3 倍。LIquid 还引入了新的数据库索引技术,支持实时数据查询,从而实现秒级推荐。

系统架构

LIquid 的架构设计旨在以较低的硬件成本实现低延迟的图查询。通过 LIquid 在经济图谱上生成的数百个候选结果,系统会应用第二个排名函数。该排名函数使用来自 Venice 的机器学习特征和来自 Apache Pinot 的分析洞察,对候选者进行评分和筛选。过滤步骤为最终渲染和评分准备排名列表。

扩展性与可用性

LIquid 的设计使其能够扩展到当前规模的十倍,以支持 LinkedIn 930 多万会员的有机增长和新语义领域。它提供了 99.99% 的可用性,并能自动扩展以适应图谱规模和活动量的增加。

查询语言与开发效率

LIquid 使用基于 Datalog 的可组合和声明性查询语言,使开发者能够高效访问和利用数据。可组合语言允许开发者在现有功能(称为模块)的基础上构建,声明性语言让开发者专注于表达意图,而 LIquid 自动处理高效访问。这种设置使开发者能够快速更改数据集,显著减少调整和更新数据库的时间。

未来规划

LinkedIn 工程总监 Bogdan Artintescu 描述了 LIquid 的未来路线图:

  1. 提高查询复杂性和数据源多样性:通过增加经济图谱中的数据源和查询复杂性,开发新功能。
  2. 数据丰富化:通过确定性算法或概率性机器学习方法创建衍生数据,或通过知识图谱(KG)模式中更丰富的语义改进推理能力。
  3. 高性能图计算与分析:专注于高性能图计算和分析,构建 KG 生态系统,进一步优化会员体验。

影响与推广

LIquid 的成功实施激励了 LinkedIn 内部其他团队以及微软的姐妹团队将其作为图索引采用。

阅读 35
0 条评论