【发布时间】:2021-10-13 08:50:45
【问题描述】:
我对 sparql 和 apache Jena 还很陌生,所以请原谅我的幼稚。 我使用 TDB2 加载程序加载了 wikidata 转储 (705G),并从 Wikidata Query Service 执行了一些查询示例。 与 Wikidata 查询服务相比,Jena 中的大多数查询需要更长的时间。 我的机器配置了 750G 的 RAM 和 80 个 CPU。 我的问题是:
- 为什么 Wikidata 服务比 Jena 更快?
- 如何在不重写查询的情况下提高查询性能?也许一些索引技术?还是特定的服务器配置?
我用 [Jena] 标签查找了所有 stackoverflow 问题,但没有找到任何相关信息。如果您可以提供除耶拿官方网站以外的教程或主题,那就太好了。
【问题讨论】:
-
WDQS 在机器集群上运行 - mediawiki.org/wiki/Wikidata_Query_Service/… 。还有一些自定义扩展 - 例如。标签服务。将编写适合 WDQS 系统的查询。
-
出于兴趣 - 您使用了哪个 wikidata 转储?您是否记录了负载以及 TDB2(并行?阶段/默认?)加载程序每一步所用的时间?
-
来自dumps.wikimedia.org/wikidatawiki/entities 的latest-truthy.nt.gz。我尝试以多种方式做到这一点。只有使用 tdbloader2data (17h 25min) 和 tdbloader2index (10h 7min) 单独加载是成功的。我没有关于其他加载的时间记录,但即使我设置了 -Xms600g -Xmx700g,它们也因 OOM 失败。
-
谢谢。令人困惑的是,这是一个 TDB1 加载器(遗留命名!)。设置 -Xmx700g 可能会减慢它的速度 - 很多第一步是由于工作在堆外。它可能会被重命名,移植到 TDB2 并在数据阶段加快一些速度,并且在旋转磁盘上也能更好地工作。
标签: jena wikidata wikidata-query-service