【问题标题】:Nutch segments disk space requirements grow fastNutch 段磁盘空间需求增长迅速
【发布时间】:2020-05-16 11:50:40
【问题描述】:

我正在运行 Nutch(1.16)/Solr(8.5.1) 爬行索引系统。我使用大约 26000 个 URL 作为种子列表,到目前为止,我已经用 ./bin/crawl -i -s ./urls data 500 索引了大约 100 万页。今天早上,segments 文件夹已经增长到 120GB,这对于一百万页来说似乎很多。我读过here 每 1 亿页 1TB 是一个粗略的空间指导,所以我的运行速度是单独分段的 10 倍。我还阅读了here,如果它们已合并到 Solr 中并且从长远来看只需要 linkdb 和 crawldb,我可以删除这些段。但遗憾的是,导致该结论的对话丢失了。

我删除了segments文件夹并再次开始该过程以获取干净的数字,而不会从测试运行中遗留下来。在向 Solr 索引添加另外 250.000 个页面后,segments 文件夹再次增长到 40GB。

所以我的问题:

  1. 当迭代合并到 Solr 时,我一般可以删除段文件吗
  2. 为什么它们没有被自动删除。按照目前的情况,我需要每隔几天清空该文件夹。
  3. 是否有某种方法可以防止段增长过快或更好地设置在 Solr 中建立索引后自动删除段。
  4. 似乎我在做一些根本错误的事情,让我的细分市场增长得如此之快。

如有必要,我可以提供配置文件,但我运行的几乎是普通配置。我将 fetcher 线程增加到 25 个,可用 RAM 增加到 24GB。

【问题讨论】:

    标签: solr web-crawler nutch


    【解决方案1】:
    1. 当迭代合并到 Solr 时,我一般可以删除段文件吗

    是的,如果您不想将该段用于其他目的。

    1. 为什么没有自动删除。

    bin/crawl 是一个易于适应您需要的 shell 脚本,只需将命令 rm -rf "$CRAWL_PATH"/segments/$SEGMENT 添加到循环中即可。但是您也可以从昨天删除段(段名称是时间戳)。有时,如果出现问题,您需要检查段以找出问题所在。

    1. 有什么方法可以防止细分市场增长如此之快

    如果您不需要抓取页面的原始内容(HTML 以及 PDF 等),则可以在 fetcher 步骤中解析文档。这通常会更快并节省段中的空间,因为只存储解析的文本和元数据。这是由以下人员配置的:

    • 将属性fetcher.parse 设置为true,
    • fetcher.store.content 为 false 和
    • 删除(注释掉)脚本bin/crawl 中的解析步骤和

    Apache Nutch 更像是一个构建爬虫的工具箱,因此没有单一的使用方法。但我们始终欢迎错误报告和建议。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-12-05
      • 2016-09-17
      • 2013-04-03
      • 2019-08-08
      • 1970-01-01
      • 2017-11-18
      相关资源
      最近更新 更多