【发布时间】:2015-11-13 12:10:00
【问题描述】:
我想这样配置:
- 书籍元数据的 RDF 数据集;
- 单独放置的书籍,如 XHTML 文件、具有唯一 ID 的段落;
- 每本书的元数据都包含
dc:source之类的文件链接(绝对的?像一个适当的 URI,那么缩放呢?);
我知道这可能很微不足道,但我无法正确理解。一开始我试图只索引纯 TXT 小文件,每个链接都来自元数据文件中的 dc:source。据我了解,这应该足以索引所有内容。我正在尝试像this post 中的那个人那样做。与他不同的是,我想索引 RDF 数据集以及外部文件。特别是这两个命令没有错误记录(相反,它记录了 57 个三元组):
java -cp /home/honza/.apache-jena-fuseki-2.3.0/fuseki-server.jar tdb.tdbloader --tdb=run/configuration/service2.ttl testDir/test_dataset.ttl
INFO -- Start triples data phase
INFO ** Load into triples table with existing data
INFO -- Start quads data phase
INFO ** Load empty quads table
INFO Load: testDir/test_dataset.ttl -- 2015/11/13 12:46:22 CET
INFO -- Finish triples data phase
INFO ** Data: 57 triples loaded in 0,29 seconds [Rate: 193,22 per second]
INFO -- Finish quads data phase
INFO -- Start triples index phase
INFO -- Finish triples index phase
INFO -- Finish triples load
INFO ** Completed: 57 triples loaded in 0,33 seconds [Rate: 172,21 per second]
INFO -- Finish quads load
和
java -cp /home/honza/.apache-jena-fuseki-2.3.0/fuseki-server.jar jena.textindexer --desc=run/configuration/service2.ttl
WARN Values stored but langField not set. Returned values will not have language tag or datatype.
之后,服务器正常运行,我看到了图表,但它不包含任何数据。
我对该服务的配置是(我不知道将服务和数据库配置放在一个文件中是否正确,对我来说目前效果更好,分割会引发一些错误):
@prefix fuseki: <http://jena.apache.org/fuseki#> .
@prefix rdf: <http://www.w3.org/1999/02/22-rdf-syntax-ns#> .
@prefix rdfs: <http://www.w3.org/2000/01/rdf-schema#> .
@prefix tdb: <http://jena.hpl.hp.com/2008/tdb#> .
@prefix ja: <http://jena.hpl.hp.com/2005/11/Assembler#> .
@prefix text: <http://jena.apache.org/text#> .
@prefix : <#> .
[] rdf:type fuseki:Server
.
<#service2> rdf:type fuseki:Service ;
rdfs:label "TDB/text service" ;
fuseki:name "test" ; # http://host:port/ds
fuseki:serviceQuery "sparql" ; # SPARQL query service
fuseki:serviceQuery "query" ; # SPARQL query service (alt name)
fuseki:serviceUpdate "update" ; # SPARQL update service
fuseki:serviceUpload "upload" ; # Non-SPARQL upload service
fuseki:serviceReadWriteGraphStore "data" ; # SPARQL Graph store protocol (read and write)
# A separate read-only graph store endpoint:
fuseki:serviceReadGraphStore "get" ; # SPARQL Graph store protocol (read only)
fuseki:dataset :text_dataset
.
[] ja:loadClass "org.apache.jena.tdb.TDB" .
tdb:DatasetTDB rdfs:subClassOf ja:RDFDataset .
tdb:GraphTDB rdfs:subClassOf ja:Model .
[] ja:loadClass "org.apache.jena.query.text.TextQuery" .
text:TextIndexLucene rdfs:subClassOf text:TextIndex .
:text_dataset rdf:type text:TextDataset ;
text:dataset <#test> ;
text:index <#indexLucene> .
【问题讨论】:
标签: lucene rdf jena full-text-indexing fuseki