【发布时间】:2018-05-22 18:49:38
【问题描述】:
我正在使用 hadoop 1.1.2、Hbase0.9 Nutch 2.2.1 和 Solr。 当我在没有 hadoop 的情况下使用 Nutch 时,一切都很好。 我可以毫无问题地启动一个单节点集群, 当我尝试使用 hadoop 在单节点模式下爬行时,我收到此警告
17/12/08 14:42:30 WARN snappy.LoadSnappy: Snappy native library not loaded
然后,在减少工作期间,我遇到了这些错误
17/12/08 14:42:57 INFO mapred.JobClient: map 100% reduce 33%
17/12/08 14:42:59 INFO mapred.JobClient: map 100% reduce 50%
17/12/08 14:43:00 INFO mapred.JobClient: map 100% reduce 66%
17/12/08 14:43:08 INFO mapred.JobClient: Task Id :
attempt_201712081441_0002_r_000000_0, Status : FAILED
java.lang.NullPointerException
at org.apache.avro.util.Utf8.<init>(Utf8.java:37)
at
org.apache.nutch.crawl.GeneratorReducer.setup(GeneratorReducer.java:100)
at org.apache.hadoop.mapreduce.Reducer.run(Reducer.java:174)
at org.apache.hadoop.mapred.ReduceTask.runNewReducer(ReduceTask.java:650)
at org.apache.hadoop.mapred.ReduceTask.run(ReduceTask.java:418)
at org.apache.hadoop.mapred.Child$4.run(Child.java:255)
at java.security.AccessController.doPrivileged(Native Method)
at javax.security.auth.Subject.doAs(Subject.java:396)
at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1149)
at org.apache.hadoop.mapred.Child.main(Child.java:249)
我正在使用 java 6,因为 java 8 我得到了同样的错误和其他警告。 要执行爬网,我使用此命令
hadoop jar apache-nutch-2.2.1.job org.apache.nutch.crawl.Crawler urls -solr http://localhost:8983/solr/ -depth 2
【问题讨论】:
-
这是您的任务尝试(尝试_201712081441_0002_r_000000_0)日志的内容吗?
-
不,当我使用问题底部的命令行时,这是我在终端中得到的输出。如您所见,当减少工作量为 66% 时它会崩溃。它总是在 66% 或 33% 时崩溃
-
您能在任务日志中发布任何错误吗?
标签: hadoop solr nullpointerexception reduce nutch