【发布时间】:2019-10-10 09:15:15
【问题描述】:
我正在尝试从游戏网站的同一网站上抓取多个页面以进行评论。
我尝试运行它并更改我在此处找到的代码:R web scraping across multiple pages 以及答案之一。
library(tidyverse)
library(rvest)
url_base <- "https://www.metacritic.com/browse/games/score/metascore/all/ps4?sort=desc&page=0"
map_df(1:17, function(i) {
cat(".")
pg <- read_html(sprintf(url_base, i))
data.frame(Name = html_text(html_nodes(pg,"#main .product_title a")),
MetaRating = as.numeric(html_text(html_nodes(pg,"#main .positive"))),
UserRating = as.numeric(html_text(html_nodes(pg,"#main .textscore"))),
stringsAsFactors = FALSE)
}) -> ps4games_metacritic
结果是第一页被抓取了 17 次,而不是网站上的 17 个页面
【问题讨论】:
-
如果您查看链接的答案,您会看到页码已替换为
%d。因此,在您的情况下,您会刮掉页码 0、17 次。请改用url_base <- "https://www.metacritic.com/browse/games/score/metascore/all/ps4?sort=desc&page=%d"。