【发布时间】:2015-05-06 13:18:29
【问题描述】:
我正在尝试使用 lucene 索引 50 亿甚至更多行的记录。 索引时间是否会随着记录集的增加而呈指数增长?
我最初对 1000 万条记录进行索引的速度非常快,但是当我尝试为超过 1 亿条记录建立索引时,相对于 1000 万条记录的索引时间而言,所花费的时间比我预期的要长。
是不是因为它针对更多文档编制索引,因此时间呈指数级增长?或者这种行为背后的原因是什么,有什么方法可以优化它(请注意,目前所有文档中的所有字段都是StringField类型,将其更改为IntField可以帮助我朝这个方向发展吗?) .
我的第二个问题是在索引 50 亿条记录的情况下搜索性能如何。有什么想法吗?
如果您需要我提供的更多信息,请告诉我。
【问题讨论】:
-
我可以通过将我的索引创建过程增加到多个 JVM 中进行扩展,所有这些 JVM 都从具有相同架构的不同文件中读取并将其存储在相同的索引文件夹位置.?????
-
单个 Lucene 索引中有 20 亿个文档的硬性限制,因此您必须以某种方式分发。
标签: java solr elasticsearch lucene search-engine