【问题标题】:Did you enter the wrong element and the results do not match?您是否输入了错误的元素,结果不匹配?
【发布时间】:2017-08-01 13:53:58
【问题描述】:

我正在抓取代码中的url。

所有元素都应该相同,

我有 33 条评论、135 颗星和 41 个日期。

我做错了什么?

我认为其中 33 个应该是正常的。

我该如何解决?

#install.packages(c("rvest","httr"))
library(rvest)
library(httr)

all.reviews <- c()
all.stars <-c()
all.dates <-c()

for (page in 1:4){
  url='https://www.amazon.com/ggplot2-Elegant-Graphics-Data-Analysis/product-reviews/0387981403/ref=cm_cr_arp_d_paging_btm_2?ie=UTF8&showViewpoints=1&sortBy=helpful&pageNumber='
  url_page <- paste0(url,page)
  reading_html <- read_html(url_page)
  text_nodes <- html_nodes(reading_html, 'span.review-text')
  review <- html_text(text_nodes)
  all.reviews<-c(all.reviews, review)

  text_date <- html_nodes(reading_html, 'span.review-date')
  date <- html_text(text_date)
  all.dates<-c(all.dates, date)

  #span.a-icon-alt

  text_star <- html_nodes(reading_html, 'span.a-icon-alt')
  star <- html_text(text_star)
  all.stars<-c(all.stars, star)

  print(page)
}

【问题讨论】:

  • 爬取亚马逊违反了他们的条款和条件。这样做并鼓励其他人加入您所说的违规行为可能会导致民事和/或刑事处罚。

标签: r parsing web-scraping web-crawler amazon


【解决方案1】:

由于@hrbrmstr 提出的关于抓取亚马逊的担忧,原始答案已被删除。

【讨论】:

  • 仅供参考:刮掉亚马逊违反了他们的条款和条件。这样做并鼓励其他人加入您所说的违规行为可能会导致民事和/或刑事处罚。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-03-13
  • 2012-07-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多