【发布时间】:2016-07-07 13:04:13
【问题描述】:
我在 IMDB 上提取了电影的评论,但单独的评论之间有很多空白行。它是非结构化的,很难查看。 我必须分别对它们中的每一个应用某些功能,然后将它们一起存储为 1 以进行某些其他功能的文本挖掘。
我如何构造(清理)它们并一次访问它们,以及如何组合它们并将它们存储在一起?
这是我用于抓取评论的代码
ID <- 1490017
URL <- paste0("http://www.imdb.com/title/", ID, "/reviews?filter=prolific")
MOVIE_URL <- read_html(URL)
ex_review <- MOVIE_URL %>%
html_nodes("p") %>%
html_text()
【问题讨论】:
标签: r web-scraping rvest