【发布时间】:2021-02-22 15:01:53
【问题描述】:
我是使用 R 进行网页抓取的初学者。我正在尝试抓取以下网页:https://bkmea.com/bkmea-members/#/company/2523。
我想用class="company_name" 获取div 节点下的所有文本元素,以及td 节点下的文本元素。例如,我正在尝试获取以下 HTML 文本中的公司名称(“MOMO APPARELS”)。
<div class="comapny_header">
<div class="company_name">MOMO APPARELS LTD</div>
<div class="view_all">View All</div>
</div>
所以我写了以下代码:
library(textreadr)
library(rvest)
companyinfo <- read_html("https://bkmea.com/bkmea-members/#/company/2523")
html_nodes(companyinfo,"div")%>%
html_text() # it works
html_nodes(companyinfo,"div.company_name")%>%
html_text() # doesn't work
html_nodes(companyinfo,"td") %>%
html_text() # doesn't work
如果我理解正确 - 第一个应该使用 div 节点提取文本。
第二个应该在div 节点中提取属性等于company_name 的文本。
第三个应该在td 节点中提取文本。
第一个有效(这不是我想要得到的),但第二个和第三个无效 - 我做错了什么吗?
如果你能在这里帮助我,我将不胜感激!
非常感谢, 桑
【问题讨论】:
标签: html r web-scraping rvest