【问题标题】:Suggestion with best customizable crawlers and scrapers最好的可定制爬虫和刮板的建议
【发布时间】:2010-11-11 05:29:37
【问题描述】:

我有一个非常好的网站,但信息非常少。 因此,我想添加有关特定行业(例如政治、好莱坞等)的新闻等信息。我相信爬虫是最好的方法吗?我的理解是否正确,如果您有其他不使用各种来源的爬虫获取信息的方式,请提出建议。

其次,我从过去 2 天开始进行研究,但我找不到能够这样做的特定来源。现在我想让爬虫找到信息,规范化并存储在 mysql 数据库中。听起来很简单哈。但它不适合我。

因为这是非常耗费资源和时间的。在选择爬虫之前我应该​​考虑什么。我还希望对其进行自定义,以便任何开源且易于自定义的工具都很棒。

在创建爬虫或对爬虫进行教育时,任何提供有关因素的信息和研究都需要考虑的来源都会很棒。 我更喜欢用 java 编码,但我可以用任何其他语言编码,以防你觉得你有某种语言。 我希望我已经提供了足够的信息。如果您需要更多信息来提供建议,请不要犹豫。

【问题讨论】:

    标签: java php web-crawler web-scraping


    【解决方案1】:

    您可以使用httrack 复制目标网站。有一个名为 spiderzilla 的 firefox 插件。但是,他们只会保存页面。

    如果你想解析页面中的数据,那么你可以使用simple_html_dom并将信息存储在mySQL中。

    【讨论】:

      【解决方案2】:

      试试GNU Wget 工具。您可以为其抓取和创建网页数据转储的方式添加大量智能。它也是开源和可定制的,而且速度也非常快。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2011-05-19
        • 2019-11-07
        • 2017-08-20
        • 1970-01-01
        • 1970-01-01
        • 2010-11-21
        • 2015-07-18
        相关资源
        最近更新 更多