【发布时间】:2015-12-23 14:47:10
【问题描述】:
我有大约 50 TB 的内容。该集合中的文档数量约为 2.5 亿。每天的增量不是很大,我大约是 10000 个不同大小的文档,总计不到 50 MB。
当前的索引工作耗时太长,估计需要 100 多天才能完成!!!
那么……这真的是那么大的数据集吗?对我来说,50 TB 的内容(在这个时代)并不是很大。你有这种大小的内容吗?如果你这样做了,你是如何减少一次性索引所花费的时间的?另外,您是如何缩短实时索引所花费的时间的?
如果你能回答..太好了。如果你能指出我正确的直接方向......也很感激。
提前致谢。
rd
【问题讨论】:
-
检查这个stackoverflow.com/a/31935578/2254048。如果它打开,还要禁用用于批量索引的 softCommit。另请阅读此wiki.apache.org/solr/SolrPerformanceFactors。
-
数字本身对于 Solr 来说毫无意义:简单的 CSV 导入可以处理 30K 文档/秒,足够复杂的 Tika 处理可能意味着 1 文档/分钟。如果 YoungHobbit 的建议没有帮助,请在更多信息中描述详细说明您正在处理哪些数据以及如何将它们添加到 Solr。
标签: performance indexing solr large-data-volumes