【发布时间】:2012-02-15 19:56:41
【问题描述】:
在用 nutch(1.4) 爬了一天之后……最后我得到了以下异常:
.
.
.
-finishing thread FetcherThread, activeThreads=0
-activeThreads=0, spinWaiting=0, fetchQueues.totalSize=0
-activeThreads=0
Fetcher: java.io.IOException: Job failed!
at org.apache.hadoop.mapred.JobClient.runJob(JobClient.java:1252)
at org.apache.nutch.fetcher.Fetcher.fetch(Fetcher.java:1204)
at org.apache.nutch.fetcher.Fetcher.run(Fetcher.java:1240)
at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65)
at org.apache.nutch.fetcher.Fetcher.main(Fetcher.java:1213)
.
.
.
我有 20 个新闻站点,nutch 的输入参数是:depth 3 和 topN -1 我在我的 linux 的根目录中有足够的空间和大约 4GB 的内存 我该如何解决这个问题? 谢谢。
【问题讨论】:
标签: web-crawler nutch ioexception