【问题标题】:AWS Neptune Gremlin paginate on hashed edge IDAWS Neptune Gremlin 在散列边 ID 上分页
【发布时间】:2019-10-09 22:43:24
【问题描述】:

我有一个非常大的数据集,接近 5 亿条边,其中几乎所有边都需要遍历。我试图通过在 IDS 上分页来并行化这些遍历。我的策略是尝试按 MD5 哈希的 ID 进行分页。我尝试了如下查询:

g.E().hasLabel('foo').has(id, TextP.startingWith('AAA')) 第 1 页 g.E().hasLabel('foo').has(id, TextP.startingWith('AAB')) 第 2 页

但每个查询似乎都在进行全面扫描,而不仅仅是一个子集。你建议我如何进行分页?

【问题讨论】:

    标签: gremlin tinkerpop amazon-neptune


    【解决方案1】:

    我建议您在查询上运行profile step 以查看实际遍历的数量。

    id 上使用startingWith 谓词对我来说似乎不是优化的解决方案,因为它可能使用哈希索引,而不是范围索引。 我会尝试在其他字符串属性上添加前缀,甚至添加一个随机 [1..n] 'replica' 属性并使用.has('replica', i) 进行过滤以获得最佳性能,尤其是在如此大的图表上。

    【讨论】:

      猜你喜欢
      • 2018-06-03
      • 2021-06-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-12-01
      • 2019-06-04
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多