【问题标题】:Configuring Tika With Solr使用 Solr 配置 Tika
【发布时间】:2013-07-12 19:23:21
【问题描述】:

我希望将丰富类型的文档(Pdf、Doc、rtf、txt)索引到 Solr。我发现 Tika 作为解决方案。我在网上大吵大闹,但没有找到任何文档/链接使其与 ExtractingRequestHandler 一起使用。

任何人都可以请提供一步一步的方法来使用 ExtractingRequestHandler 配置 Tika。

提前致谢:)

【问题讨论】:

  • 在您搜索资源的过程中,您是否尝试过ExtractingRequestHandler documentation
  • 我目前正在使用 Solr-Php-Client 库来索引内容。现在要索引文档,我发现 tika 作为解决方案。但找不到如何使用 solr 配置它?请你简要解释一下。或任何有用的链接/文档?
  • 引用上面链接的文档:“Solr 的 ExtractingRequestHandler 使用 Tika 允许用户将二进制文件上传到 Solr 并让 Solr 从中提取文本,然后对其进行索引。”这不是特例,ExtractingRequestHandler 就是这样工作的。该文档应该可以帮助您入门。如果您在使用过程中遇到麻烦,请随时提出新问题来帮助解决问题,但您应该先尝试一下。
  • 感谢@femtoRgon 我浏览了文档。我无法弄清楚这条线。 /my/path/to/tika.configSolr 抛出未找到文件异常。我在哪里可以找到这个文件?

标签: solr apache-tika


【解决方案1】:

检查 ExtractingRequestHandler 以了解 Solr 与 Tika 的集成。
Solr 提供了 tika.config 内置,除非覆盖配置,否则您不需要定义它。
您可以使用 solrconfig.xml 中定义的默认配置

<!-- Solr Cell Update Request Handler

   http://wiki.apache.org/solr/ExtractingRequestHandler 

-->
<requestHandler name="/update/extract" 
              startup="lazy"
              class="solr.extraction.ExtractingRequestHandler" >
<lst name="defaults">
  <str name="lowernames">true</str>
  <str name="uprefix">ignored_</str>

  <!-- capture link hrefs but ignore div attributes -->
  <str name="captureAttr">true</str>
  <str name="fmap.a">links</str>
  <str name="fmap.div">ignored_</str>
</lst>
</requestHandler>

您可以使用命令来索引文件以使用其他元数据进行 solr。

curl "http://localhost:8983/solr/update/extract?literal.id=2&literal.title=Test&commit=true&fmap.content=text" -F "myfile=@1.pdf"

默认情况下,文件内容复制到内容字段并复制到文本,您可以覆盖设置。

【讨论】:

  • @jayedra 一个问题!在索引非 pdf 类型时,它会引发 Java.lang.noClassDefFoundError。有什么线索吗??
  • 谢谢 Jayendra 这是一个 URL 问题,所以码头抛出异常无论如何都解决了。但现在我无法使用 solr Query 看到我的文档。 有什么问题可能有任何线索?
  • @jayedra 这是我的查询:-stackoverflow.com/questions/17697019/…
猜你喜欢
  • 2011-08-09
  • 2011-09-05
  • 2013-01-15
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多