【问题标题】:Java Web crawler and scraperJava Web 爬虫和爬虫
【发布时间】:2019-11-07 04:30:31
【问题描述】:

我的目的是从各个网站读取产品的成本详细信息,以便我可以在我的 Spring 应用程序的 html 页面中显示成本比较详细信息。任何人都可以建议我如何做到这一点。有没有什么技术可以做到这一点?这样我就可以随时从其他网站读取更新的数据并将其显示在我的 Spring 应用程序中。我将一些 Web scraper 工具视为 Chrome 扩展,但它会生成 Excel 工作簿。我如何在我的 Spring 应用程序中使用它并在 HTML 页面中显示它?

【问题讨论】:

标签: java web browser


【解决方案1】:

您可以从 Spring 应用程序发送 http 查询并解析更新数据的答案。或者,您可以使用任何外部工具来抓取您想要的任何内容并保存结果(例如作为 Excel 工作簿),您的应用程序将读取此结果并根据需要进行处理。

【讨论】:

    【解决方案2】:

    有很多基于开源 Java 和 python 的爬虫现成可用,您可以根据需要进行配置,其中一些如下所述。

    阿帕奇纳奇 风暴爬行者 汤 短途旅行

    在您的情况下,由于您需要产品页面中的唯一价格,因此您可以使用 JSoup(Java 中可用的框架)或 Python 中的 Beautiful Soup 模块构建自己的价格。

    如果规模不是问题,并且您只想每天抓取一些页面,我建议您构建自己的抓取工具。否则,您可以使用 Nutch 或 StormCrawler

    另外,对于定制,请不要为不同的网页设置多个选择器,实际上只需找出一个通用的标签、CSS 或模板即可。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-06-24
      • 2016-02-06
      • 1970-01-01
      • 2018-08-13
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多