【发布时间】:2018-10-31 13:39:01
【问题描述】:
我在 XML 中列出了各种语言的植物名称(植物名称;英语、德语和这两种语言的大量历史变体)(但是,将其转换为任何序列化都不成问题)。这是现在的样子:
<ingredients>
<ingredient>
<lemma>Rosmarinus officinalis L.</lemma>
<syn lang="deu">Rosmarin</syn>
<syn lang="ang">boþen</syn>
<syn lang="ang">feldmædere</syn>
<syn lang="ang">lauendie</syn>
<syn lang="eng">rosemary</syn>
<syn lang="ang">sundēaw</syn>
</ingredient>
<ingredient>
...
</ingredients>
现在我想知道是否有一种方法可以将受控词汇表中的 Wikidata 和/或其他 URI 自动分配到此列表中。当然,考虑到不匹配 100% 的字符串的可管理错误率。可以通过哪些途径获得:
<ingredient wikidata="Q122679">
<lemma>Rosmarinus officinalis L.</lemma>
...
感谢您的任何想法!
【问题讨论】:
-
通过
rdfs:label属性查找SPARQL。确实可能会失败,因为 1)同音异义词 2)数据集中没有完全匹配的标签
标签: xml sparql semantic-web assign wikidata