【发布时间】:2011-09-30 01:47:51
【问题描述】:
这是一个 Solr 新手问题 - 但了解 Solr 的工作原理以及它是否适合我的项目对我来说非常重要。
我想索引二进制文档,即 MS-Office 文档和 PDF。我知道 Solr 可以索引这些文档的内容,并且我可以构建查询来获取我指定的值和字段作为结果。我的问题是 PDF(或任何文档)在扫描后会发生什么?它是实际存储还是完全丢弃,我可以获得原始文档的参考/链接吗?从 solr 返回的位置(路径)还是我必须在提交文档时传递此信息?
有人可以帮我理解这个吗?
【问题讨论】: