【问题标题】:Reference to original document kept?参考保存的原始文件?
【发布时间】:2011-09-30 01:47:51
【问题描述】:

这是一个 Solr 新手问题 - 但了解 Solr 的工作原理以及它是否适合我的项目对我来说非常重要。

我想索引二进制文档,即 MS-Office 文档和 PDF。我知道 Solr 可以索引这些文档的内容,并且我可以构建查询来获取我指定的值和字段作为结果。我的问题是 PDF(或任何文档)在扫描后会发生什么?它是实际存储还是完全丢弃,我可以获得原始文档的参考/链接吗?从 solr 返回的位置(路径)还是我必须在提交文档时传递此信息?

有人可以帮我理解这个吗?

【问题讨论】:

    标签: indexing solr


    【解决方案1】:

    基本上你可以索引任何你想要的东西,SOLR 将允许你搜索它并返回结果。例如,我们使用 Nutch 为我们的网站建立索引,并且我们有自制的 Groovy 脚本,可以从数据库中提取数据并创建 SOLR 索引。

    重要的部分是您如何构建索引。如果您提供 URL 或其他资源定位器以能够链接到您的文件,那么您可以让 SOLR 在结果负载中返回该信息。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2012-05-17
      • 2012-10-27
      • 2020-02-16
      • 1970-01-01
      • 1970-01-01
      • 2021-07-04
      • 2018-03-24
      • 2013-03-12
      相关资源
      最近更新 更多