【发布时间】:2020-05-16 11:50:40
【问题描述】:
我正在运行 Nutch(1.16)/Solr(8.5.1) 爬行索引系统。我使用大约 26000 个 URL 作为种子列表,到目前为止,我已经用 ./bin/crawl -i -s ./urls data 500 索引了大约 100 万页。今天早上,segments 文件夹已经增长到 120GB,这对于一百万页来说似乎很多。我读过here 每 1 亿页 1TB 是一个粗略的空间指导,所以我的运行速度是单独分段的 10 倍。我还阅读了here,如果它们已合并到 Solr 中并且从长远来看只需要 linkdb 和 crawldb,我可以删除这些段。但遗憾的是,导致该结论的对话丢失了。
我删除了segments文件夹并再次开始该过程以获取干净的数字,而不会从测试运行中遗留下来。在向 Solr 索引添加另外 250.000 个页面后,segments 文件夹再次增长到 40GB。
所以我的问题:
- 当迭代合并到 Solr 时,我一般可以删除段文件吗
- 为什么它们没有被自动删除。按照目前的情况,我需要每隔几天清空该文件夹。
- 是否有某种方法可以防止段增长过快或更好地设置在 Solr 中建立索引后自动删除段。
- 似乎我在做一些根本错误的事情,让我的细分市场增长得如此之快。
如有必要,我可以提供配置文件,但我运行的几乎是普通配置。我将 fetcher 线程增加到 25 个,可用 RAM 增加到 24GB。
【问题讨论】:
标签: solr web-crawler nutch