【发布时间】:2021-07-19 18:39:36
【问题描述】:
我是一个绝对的 R 初学者,我一直在尝试从this Sprinter Sports page抓取鞋子价格,最终目标是拥有一个每天自动加载的数据集, (i) 我感兴趣的鞋子的原价和 (ii) 折扣价。
问题在于,目前在售的 24 款鞋子中,只有 16 款同时具有“原价”和“折扣”价格。其余 8 个没有“折扣”价格,因为它们没有以折扣价出售。由于“原始”列有 24 个观察值,而“折扣”列只有 16 个,因此我无法将它们连接到数据集中。
我怎样才能在没有折扣的情况下加载鞋子,以使它们的“折扣”列设置为 NA?我的代码如下。谢谢!
date_today = substring(gsub("-", "", Sys.Date()),3)
page_sp_merrel <- read_html("https://www.sprintersports.com/pt/sapatilhas-merrell-homem?page=1&per_page=50")
price_old_sp_merrel <- page_sp_merrel %>%
html_nodes(".product-card__info-price-old") %>%
html_text()
price_new_sp_merrel <- page_sp_merrel %>%
html_nodes(".product-card__info-price-actual") %>%
html_text()
product_name_sp_merrel <- page_sp_merrel %>%
html_nodes(".col-md-3 .product-card__info-name") %>%
html_text()
sp_merrel_df <- tibble(
price_old = price_old_sp_merrel,
price_new = price_new_sp_merrel,
product_name = product_name_sp_merrel,
date = date_today
)
【问题讨论】:
标签: r web-scraping rvest