【问题标题】:Webcrawler doesn't work in RapidMiner 9.2, any idea why?Webcrawler 在 RapidMiner 9.2 中不起作用,知道为什么吗?
【发布时间】:2019-03-06 22:57:08
【问题描述】:

我是 Rapid Miner 的新手,尤其是 Webcrawler (Crawl Web)。我从任何论坛的现有帖子中学习了示例,但似乎 Rapid Miner 9.2 中的 Web Crawler 无法正常工作,因为它在我的机器上给出了空白结果。这是示例之一,

<?xml version="1.0" encoding="UTF-8"?><process version="9.2.000">
  <context>
    <input/>
    <output/>
    <macros/>
  </context>
  <operator activated="true" class="process" compatibility="9.2.000" expanded="true" name="Process">
    <parameter key="logverbosity" value="init"/>
    <parameter key="random_seed" value="2001"/>
    <parameter key="send_mail" value="never"/>
    <parameter key="notification_email" value=""/>
    <parameter key="process_duration_for_mail" value="30"/>
    <parameter key="encoding" value="SYSTEM"/>
    <process expanded="true">
      <operator activated="true" class="web:crawl_web_modern" compatibility="9.0.000" expanded="true" height="68" name="Crawl Web X" width="90" x="112" y="85">
        <parameter key="url" value="https://www.dw.com/search/en?searchNavigationId=9097&languageCode=en&origin=gN&item=brexit"/>
        <list key="crawling_rules">
          <parameter key="follow_link_with_matching_url" value=".+search.+"/>
          <parameter key="follow_link_with_matching_url" value=".+news.+"/>
          <parameter key="store_with_matching_url" value=".+brexit.+"/>
        </list>
        <parameter key="max_crawl_depth" value="10"/>
        <parameter key="retrieve_as_html" value="true"/>
        <parameter key="enable_basic_auth" value="false"/>
        <parameter key="add_content_as_attribute" value="false"/>
        <parameter key="write_pages_to_disk" value="true"/>
        <parameter key="include_binary_content" value="false"/>
        <parameter key="output_dir" value="/Users/iqbalakbar/Desktop"/>
        <parameter key="output_file_extension" value="html"/>
        <parameter key="max_pages" value="20"/>
        <parameter key="max_page_size" value="1000"/>
        <parameter key="delay" value="0"/>
        <parameter key="max_concurrent_connections" value="100"/>
        <parameter key="max_connections_per_host" value="50"/>
        <parameter key="user_agent" value="rapidminer-web-mining-extension-crawler"/>
        <parameter key="ignore_robot_exclusion" value="false"/>
      </operator>
      <connect from_op="Crawl Web X" from_port="example set" to_port="result 1"/>
      <portSpacing port="source_input 1" spacing="0"/>
      <portSpacing port="sink_result 1" spacing="0"/>
      <portSpacing port="sink_result 2" spacing="0"/>
    </process>
  </operator>
</process>

感谢您的 cmets 和反馈。谢谢你。

伊克巴尔

【问题讨论】:

    标签: web-crawler rapidminer


    【解决方案1】:

    网络爬虫运营商有一些问题,请查看 RapidMiner 社区,其他人也有类似问题 [1]。

    目前的解决方法是将“获取页面”与循环运算符结合使用,如下所述:[2]

    希望对您有所帮助。

    [1]https://community.rapidminer.com/discussion/55201/web-crawling-of-https-pages-not-working-by-using-crawl-web

    [2]https://community.rapidminer.com/discussion/54662/how-can-i-crawl-more-than-one-web-page

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2021-04-24
      • 1970-01-01
      • 1970-01-01
      • 2022-08-23
      • 2013-05-14
      • 2017-10-30
      • 1970-01-01
      相关资源
      最近更新 更多