【问题标题】:rvest not suitable for this scraping functionalityrvest 不适合这种抓取功能
【发布时间】:2018-03-01 10:51:06
【问题描述】:

我正在尝试使用 R 对该网页的标题内容进行网络抓取,但 rvest 并不是完成这项工作的好工具。

我的代码:

url <-"https://letterboxd.com/crew/list/most-fans-on-letterboxd-with-pronoun-she/"

title <- read_html(url) %>% 
  html_nodes("span .frame-title") %>% # selector 
  html_text()  

哪个应该给我与给定节点关联的标题(使用示例:电影Her (2013))...

<span class="frame-title" data-reactid=".c.3.1">Her (2013)</span>

...但是我每次和每个插槽都得到空白(“”)输出。

我正在考虑使用RCurl 软件包,但我不知道它是否真的有助于我提取节点的情况。我需要这个部门的一些帮助来获取这个网页的“框架标题”下的标题。任何帮助将不胜感激。

【问题讨论】:

    标签: r web-scraping rvest httr


    【解决方案1】:

    该网站的页面来源与您发布的内容不同。下面应该解决它:

    read_html(url) %>% 
        html_nodes("img") %>% 
        html_attr("alt")
    

    【讨论】:

    • 感谢您的回复!发布问题后不久我得出了相同的结论,但我仍然很好奇其他人可能会说什么,因为一开始我没有检查页面来源。我在其中找到了我们在其中一部电影标题上使用 Chrome 上的 inspect element 功能的节点,并且能够找到嵌入在 html 骨架中的站点的这个特定节点。如果我遇到类似的问题,如果我无法以找到此解决方案的类似方式找到我正在寻找的内容怎么办?我不知道如何在 R 上实现高级网络抓取,所以我想知道。
    • 您可以将下载的url保存在html文件中查看。最后,它下载网页并解析它以获取信息。
    猜你喜欢
    • 2017-03-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-01-10
    • 2023-03-26
    • 2020-10-15
    • 2011-01-11
    • 2020-07-18
    相关资源
    最近更新 更多