【问题标题】:java.io.IOException: Job failedjava.io.IOException:作业失败
【发布时间】:2012-03-28 22:02:11
【问题描述】:

我正在尝试使用“Apache Nutch 1.4”为网站编制索引,当我运行以下命令时,出现以下错误“java.io.IOException: Job failed”

bin/nutch solrindex http://localhost:8983/solr/ crawl/crawldb -linkdb crawl/linkdb crawl/segments/*

我安装了“Tomca6”和“Apache Solr 3.5.0”以使用 Nutch,但不幸的是无法正常工作

模拟

root@debian:/usr/share/nutch/runtime/local$ bin/nutch solrindex     http://localhost:8983/solr/ crawl/crawldb -linkdb crawl/linkdb crawl/segments/*
SolrIndexer: starting at 2012-03-28 18:45:25
Adding 48 documents
java.io.IOException: Job failed!
root@debian:/usr/share/nutch/runtime/local$

有人可以帮帮我吗?

【问题讨论】:

  • 你在某处有异常堆栈跟踪的日志文件吗?
  • 我在下面的链接放了一段日志给你看...Hadoop.log
  • @Agutoli 我建议您查看您的 solr 日志文件,以了解您从 Solr 获得的 BadRequest 错误的原因。你能把它的相关部分贴在这里吗?
  • 我找到的唯一日志就是这个,不记录堆栈跟踪 Solr Haddop.log

标签: apache solr lucene tomcat6 nutch


【解决方案1】:

如果 nutch 结果字段到 Solr 字段的映射不正确或不完整,通常会发生此错误。这会导致 Solr 服务器拒绝“更新”操作。不幸的是,在调用链中的某个时刻,这个错误被转换为“IO 错误”,这有点误导。我的建议是访问 Solr 服务器的 Web 控制台(可使用与提交链接相同的 URL 访问,例如在本例中为 http://some.solr.server:8983/solr/)并转到日志记录选项卡。有关映射的错误将显示在那里!

【讨论】:

    【解决方案2】:

    看起来 Solr 配置不正确。 (请确保输入的 linkdb、 crawldb 和 segment 存在于您传递命令行的位置)。

    阅读

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2021-08-30
      • 1970-01-01
      • 1970-01-01
      • 2013-11-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多