【问题标题】:Jena Query OptimizationJena 查询优化
【发布时间】:2021-10-13 08:50:45
【问题描述】:

我对 sparql 和 apache Jena 还很陌生,所以请原谅我的幼稚。 我使用 TDB2 加载程序加载了 wikidata 转储 (705G),并从 Wikidata Query Service 执行了一些查询示例。 与 Wikidata 查询服务相比,Jena 中的大多数查询需要更长的时间。 我的机器配置了 750G 的 RAM 和 80 个 CPU。 我的问题是:

  1. 为什么 Wikidata 服务比 Jena 更快?
  2. 如何在不重写查询的情况下提高查询性能?也许一些索引技术?还是特定的服务器配置?

我用 [Jena] 标签查找了所有 stackoverflow 问题,但没有找到任何相关信息。如果您可以提供除耶拿官方网站以外的教程或主题,那就太好了。

【问题讨论】:

  • WDQS 在机器集群上运行 - mediawiki.org/wiki/Wikidata_Query_Service/… 。还有一些自定义扩展 - 例如。标签服务。将编写适合 WDQS 系统的查询。
  • 出于兴趣 - 您使用了哪个 wikidata 转储?您是否记录了负载以及 TDB2(并行?阶段/默认?)加载程序每一步所用的时间?
  • 来自dumps.wikimedia.org/wikidatawiki/entities 的latest-truthy.nt.gz。我尝试以多种方式做到这一点。只有使用 tdbloader2data (17h 25min) 和 tdbloader2index (10h 7min) 单独加载是成功的。我没有关于其他加载的时间记录,但即使我设置了 -Xms600g -Xmx700g,它们也因 OOM 失败。
  • 谢谢。令人困惑的是,这是一个 TDB1 加载器(遗留命名!)。设置 -Xmx700g 可能会减慢它的速度 - 很多第一步是由于工作在堆外。它可能会被重命名,移植到 TDB2 并在数据阶段加快一些速度,并且在旋转磁盘上也能更好地工作。

标签: jena wikidata wikidata-query-service


【解决方案1】:

您可以尝试使用下一代 TDB2(而不是 TDB1)。

tdb2.tdbloader --loc /path/to/tdb2/ /path/to/some.ttl

此外,默认情况下,构建这样的 TDB2 不会生成统计信息。您必须手动执行此操作。首先 cd 到您创建的 TDB2(按照上面的示例 /path/to/tdb2)并运行(在 bash 中):

tdb2.tdbstats --loc=`pwd` > /tmp/stats.opt
mv /tmp/stats.opt > /path/to/tdb2/Data-0001/

统计信息“指导优化器选择一个执行计划而不是另一个”,这可以帮助您获得更好的查询性能。 https://jena.apache.org/documentation/tdb/optimizer.html#running-tdbstats

【讨论】:

猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-09-25
  • 2012-06-15
  • 2011-01-19
相关资源
最近更新 更多