【问题标题】:Efficient looping of a page with multi subpages and storing all of them in one variable?具有多个子页面的页面的有效循环并将它们全部存储在一个变量中?
【发布时间】:2015-09-18 20:27:47
【问题描述】:

假设我将以下页面作为字符串:

X <- "http://www.rightmove.co.uk/property-for-sale/Glasgow.html?sortType=6&maxPrice=50000&displayPropertyType=flats&numberOfPropertiesPerPage=50&index=0"

现在我想通过最后一个相邻元素来迭代它

"index=0".

每次迭代都会增加 50,可以说直到 500。所以我现在有 11 个字符串,最后有差异:

"index=0"
"index=50"
"index=100"
...
"index=500"

我的问题是如何快速将每个字符串存储到同一个变量中,以便完成后我可以使用该变量作为参数,通过执行 greps、gsubs 和 regexps 来进一步提取数据? 我的意思是我想通过每个字符串下载整个页面源,这只是一个指向网站的指针。

【问题讨论】:

    标签: r iteration webpage


    【解决方案1】:

    您是否正在尝试构建网络scraper f?

    以我个人的经验,最好的方法是在页面中找到“下一页”按钮并从中解析下一个 URL。这样您就可以模拟用户点击,您的程序将准确地知道在哪里停止。

    我还存储已处理的 url,以防止无限循环。

    【讨论】:

      猜你喜欢
      • 2016-11-08
      • 2020-08-16
      • 2013-03-09
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多