【问题标题】:Iterate over specific resource in RDF file with Jena使用 Jena 遍历 RDF 文件中的特定资源
【发布时间】:2013-06-05 11:48:46
【问题描述】:

我正在使用 Apache Jena 读取 RDF 文件,如下所示:

<rdf:RDF
    xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#"
    xmlns:dcat="http://www.w3.org/ns/dcat#"
    xmlns:skos="http://www.w3.org/2004/02/skos/core#"
    xmlns:foaf="http://xmlns.com/foaf/0.1/"
    xmlns:owl="http://www.w3.org/2002/07/owl#"
    xmlns:dct="http://purl.org/dc/terms/"
    xmlns:dctypes="http://purl.org/dc/dcmitype/"
    xmlns:rdfs="http://www.w3.org/2000/01/rdf-schema#">
  <dcat:Catalog rdf:about="http://uri/">
    <dcat:dataset>
      <dcat:Dataset rdf:about="http://url/bop2262008322pdf/">
        <dct:publisher>
          <foaf:Organization>
            <foaf:homepage rdf:resource="http://url"/>
            <dct:title xml:lang="ca">Neme</dct:title>
          </foaf:Organization>
        </dct:publisher>
        <dcat:distribution>
          <dcat:Download>
            <dct:modified rdf:datatype="http://www.w3.org/2001/XMLSchema#date"
            >2012-11-09T16:23:22</dct:modified>
            <dct:format>
              <dct:IMT>
                <rdfs:label>pdf</rdfs:label>
                <rdf:value>application/pdf</rdf:value>
              </dct:IMT>
            </dct:format>
            <dcat:accessURL>http://url/</dcat:accessURL>
          </dcat:Download>
        </dcat:distribution>
        <dcat:keyword xml:lang="ca">Keyword 2</dcat:keyword>
        <dcat:keyword xml:lang="ca">Keyword</dcat:keyword>
        <dct:creator>Creator</dct:creator>
        <dct:modified rdf:datatype="http://www.w3.org/2001/XMLSchema#date"
        >2013-04-16T12:27:14</dct:modified>
        <dct:issued rdf:datatype="http://www.w3.org/2001/XMLSchema#date"
        >2011-03-02T10:28:58</dct:issued>
      </dcat:Dataset>
    </dcat:dataset>
    <dct:license rdf:resource="http://creativecommons.org/licenses/by/3.0/"/>
    <dct:title xml:lang="es">Example</dct:title>
    <dct:title xml:lang="ca">Example</dct:title>
  </dcat:Catalog>
</rdf:RDF>

我基本上想得到每一个dcat:dataset 资源和相应的语句。但我不知道如何从特定命名空间和本地名称(在本例中为dcat:dataset)遍历所有资源。我想通过包含属性来查找资源是可能的。然而,命名空间dcat 似乎不受耶拿的支持。我在词汇表里找不到。

【问题讨论】:

    标签: rdf jena


    【解决方案1】:

    在大多数情况下,本地名称和前缀仅在序列化中很重要。虽然 RDF/XML 文件包含

    <dcat:Catalog rdf:about="http:/uri/>
      <dcat:dataset>
        <dcat:Dataset rdf:about="http://url/bop2262008322pdf/">
        …
    

    您的 RDF 图实际上包含三元组:

    <http:/uri/> <http://www.w3.org/ns/dcat#dataset> <http://url/bop2262008322pdf/>
    

    这是一个重要的区别,因为序列化图可以使用不同的前缀并产生不同的输出。例如,您的 RDF/XML 文档可能还具有前缀 dcatdata:

    <rdf:RDF
      xmlns:dcatdata="http://www.w3.org/ns/dcat#data"
      >
    

    之后您的 RDF/XML 文档可能如下所示:

    <dcat:Catalog rdf:about="http:/uri/>
      <dcatdata:set>
        <dcat:Dataset rdf:about="http://url/bop2262008322pdf/">
        …
    

    因此,您不应依赖特定前缀,而应通过其 IRI 访问资源。在这种情况下,听起来您想使用rdf:type dcat:Dataset 检索资源以及将这些资源作为主题的语句。使用 Jena 模型和资源 API 很容易做到这一点。这是一个例子:

    import com.hp.hpl.jena.rdf.model.Model;
    import com.hp.hpl.jena.rdf.model.ModelFactory;
    import com.hp.hpl.jena.rdf.model.ResIterator;
    import com.hp.hpl.jena.rdf.model.Resource;
    import com.hp.hpl.jena.rdf.model.StmtIterator;
    import com.hp.hpl.jena.vocabulary.RDF;
    
    public class DCATExample {
      public static void main(String[] args) {
        final String dcat = "http://www.w3.org/ns/dcat#";
        Model model = ModelFactory.createDefaultModel();
        model.read( "data.rdf" );
        Resource datasetType = model.getResource( dcat + "Dataset" );
        ResIterator datasets = model.listSubjectsWithProperty( RDF.type, datasetType );
        while ( datasets.hasNext() ) {
          Resource dataset = datasets.next();
          StmtIterator stmts  = dataset.listProperties();
          System.out.println( "* "+dataset );
          while ( stmts.hasNext() ) {
            System.out.println( "** "+stmts.next() );
          }
        }
      }
    }
    

    这会产生这个输出:

    * http://url/bop2262008322pdf/
    ** [http://url/bop2262008322pdf/, http://purl.org/dc/terms/publisher, -7ec508e8:13f14cb9040:-7ffd]
    ** [http://url/bop2262008322pdf/, http://www.w3.org/ns/dcat#distribution, -7ec508e8:13f14cb9040:-7fff]
    ** [http://url/bop2262008322pdf/, http://www.w3.org/ns/dcat#keyword, "Keyword 2"@ca]
    ** [http://url/bop2262008322pdf/, http://www.w3.org/ns/dcat#keyword, "Keyword"@ca]
    ** [http://url/bop2262008322pdf/, http://purl.org/dc/terms/creator, "Creator"]
    ** [http://url/bop2262008322pdf/, http://purl.org/dc/terms/modified, "2013-04-16T12:27:14"^^http://www.w3.org/2001/XMLSchema#date]
    ** [http://url/bop2262008322pdf/, http://purl.org/dc/terms/issued, "2011-03-02T10:28:58"^^http://www.w3.org/2001/XMLSchema#date]
    ** [http://url/bop2262008322pdf/, http://www.w3.org/1999/02/22-rdf-syntax-ns#type, http://www.w3.org/ns/dcat#Dataset]
    

    【讨论】:

    • 非常感谢你,约书亚!到目前为止完美运行。我想我对 RDF 的理解有误。
    • @linsenfips 很高兴听到它的工作!您在发布之前是否修改了 RDF?我必须进行一些编辑才能让它与 Jena 一起读/写。某些 URI 格式不正确,并且缺少 &lt;/rdf:RDF&gt;
    • 是的,我剪了。实际文件有 300 个数据集条目。
    • @lisenfips 如果 Joshua 的回答解决了您的问题,请不要忘记接受它作为答案 - 如果您不知道该怎么做,请参阅 meta.stackexchange.com/a/5235/133890
    猜你喜欢
    • 2014-06-27
    • 1970-01-01
    • 2011-10-17
    • 1970-01-01
    • 2010-12-08
    • 1970-01-01
    • 2012-12-07
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多