【问题标题】:IOExeption when crawling with nutch用 nutch 爬行时出现 IOException
【发布时间】:2012-02-15 19:56:41
【问题描述】:

在用 nutch(1.4) 爬了一天之后……最后我得到了以下异常:

.
.
.

-finishing thread FetcherThread, activeThreads=0
-activeThreads=0, spinWaiting=0, fetchQueues.totalSize=0
-activeThreads=0
Fetcher: java.io.IOException: Job failed!
    at org.apache.hadoop.mapred.JobClient.runJob(JobClient.java:1252)
    at org.apache.nutch.fetcher.Fetcher.fetch(Fetcher.java:1204)
    at org.apache.nutch.fetcher.Fetcher.run(Fetcher.java:1240)
    at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65)
    at org.apache.nutch.fetcher.Fetcher.main(Fetcher.java:1213)
.
.

.

我有 20 个新闻站点,nutch 的输入参数是:depth 3 和 topN -1 我在我的 linux 的根目录中有足够的空间和大约 4GB 的内存 我该如何解决这个问题? 谢谢。

【问题讨论】:

    标签: web-crawler nutch ioexception


    【解决方案1】:

    我想你可能有这个问题:http://wiki.apache.org/nutch/NutchGotchas

    那里提供的答案是:

    我们发现解决这种情况的答案是您很可能在 /tmp 中的磁盘空间不足。考虑使用另一个位置,或者可能为 hadoop.tmp.dir(可以在 nutch-site.xml 中设置)使用另一个分区,为大型临时文件提供足够的空间,或者使用 Hadoop 集群。

    【讨论】:

    • 我已经为我的 /tmp 指定了很大的空间,但没有任何改变,并且发生了同样的异常。是否有任何错误配置?
    • 我不确定还有什么问题,但是您能确保您没有用完空间吗?查看您在 tmp 文件夹中有多少数据,并确认您没有超过您指定的空间。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-09-06
    • 2013-08-29
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多