【问题标题】:Cheerio Web Scrape how to webscrape inside of a webscrapeCheerio Web Scrape 如何在网络刮刀内进行网络刮擦
【发布时间】:2016-06-08 16:39:49
【问题描述】:

我有一个特定页面,我从其中抓取了一些数据,但要收集更多信息,我需要点击另一个 href 链接来收集该特定项目的更多数据,我不知道如何。

这是我目前所拥有的:

       router.get("/:id",function(req,res){
       var url = "www.someurl.com"

       request(url, function (error, response, html){
       if (!error && response.statusCode == 200){
        $ = cheerio.load(html);

       $('div.ProductDetails').each(function(){// function for details
          var self = this;
          var a = $(this).children().children();
          details = a.attr('href');

          details = {
          details:details
      };

这为我提供了包含实际详细信息的详细信息部分的链接。我只需要知道如何在一个scrape里面做一个scrape。

【问题讨论】:

    标签: javascript node.js web-scraping cheerio


    【解决方案1】:

    和第一次一样,details.details<a> 标签中的 url。

    所以你需要向那个 url 发出请求

    request(details.details, function(err, res, html) { /* code */ })

    然后使用cheerio提取数据。

    【讨论】:

    • 我试图通过对详细信息进行另一个请求来做到这一点,但我收到一条错误消息,指出未定义详细信息。我需要一种方法来设置路由器功能的详细信息。
    猜你喜欢
    • 2021-09-07
    • 1970-01-01
    • 2014-08-10
    • 2015-09-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2018-10-29
    • 2021-08-09
    相关资源
    最近更新 更多