【问题标题】:Crawl Anywhere+Solr+ Tomcat: not able to access the crawler administrationCrawl Anywhere+Solr+ Tomcat:无法访问爬虫管理
【发布时间】:2013-12-02 08:28:01
【问题描述】:

问题更新:感谢 Okke Klein 的更新。

我正在尝试在任何地方实现抓取以抓取 doc 文件夹。

我按照http://www.crawl-anywhere.com/installation-v300/中指定的说明进行操作

已安装 tomcat 和 Apache 网络服务器。

所以我正在尝试使用 :: http///crawler 登录爬虫。

但我收到的消息是

在此服务器上找不到请求的 URL /crawler。

Apache/2.0.64 (Win32) 服务器在 localhost 端口 80

对于 ://ip:8180/crawlerws 它给出:

<error>
<errno>1</errno>
<errmsg>Missing action</errmsg>
</error>

谁能告诉我缺少什么以及如何登录爬虫管理员。

【问题讨论】:

    标签: solr tomcat7 web-crawler solrj


    【解决方案1】:

    Crawler admin 不在 Tomcat 下运行。它在 Apache 下运行。

    您的 Solr 似乎也没有运行。但是,管理界面不需要这样做。

    crawlerws 在查看响应时运行良好。但是,这仅用于管理界面中的某些交互,并不重要。

    因此,请重新阅读 Apache 设置部分以运行管理界面。它可能已经在http://ip:80/crawler 下运行。

    【讨论】:

    • 是的..我解决了solr问题..我使用的war文件不正确..是否有另一种方法可以在没有Web服务器和管理员控制的情况下抓取文件...在他们要求的网站链接中先登录开始爬取
    • 您不需要管理员控制来抓取。但是规则的配置更容易。
    • 现在我没有安装网络服务器..我想抓取这些文件..你能指导我吗?有没有可用的文件。在没有爬虫管理员的情况下进行爬网
    • 安装 Web 服务器比尝试在没有服务器的情况下运行 CA 要容易得多。尤其是高级选项,不能在配置文件中配置。
    • 我安装了网络服务器,但仍然无法打开爬虫...更改了“install/crawler/apache/httpd_crawler.conf”文件。我们还需要对 apache Web 服务器 http.conf 文件进行任何更改吗?
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-12-19
    • 2017-01-17
    • 1970-01-01
    相关资源
    最近更新 更多