【发布时间】:2018-01-15 21:14:41
【问题描述】:
我正在尝试抓取网站 fairgodboss.com 并在检索评论日期时遇到问题...当我在 rvest 包下运行以下命令时:
url<-read_html('https://fairygodboss.com/company-reviews/boston-consulting-group')
Review<-url %>%
html_nodes(xpath ='//p[@class="textColor6 w-700 p-b-10"]')%>%
html_text()
我应该得到不同的日期作为 2017/2016,但我得到的日期都是 1970 年 1 月。
请你帮我找出问题。
我也用bs4在Python上试过如下,我到处都是1970:
import urllib
r = urllib.urlopen('https://fairygodboss.com/company-reviews/boston-consulting-group').read()
【问题讨论】:
-
抓取本网站违反条款和条件。
-
我这样做是为了学术和学习目的,非商业用途。
标签: python r web-scraping beautifulsoup rvest