【发布时间】:2021-05-20 17:10:50
【问题描述】:
我在尝试从某个页面抓取表格内容时遇到问题。此代码显示 5 个表
page <- read_html('https://wybory.gov.pl/sejmsenat2019/pl/kandydaci/sejm/1')
page %>% html_nodes('table')
当指定更多时
page %>%
html_nodes('div.con_can')
html_nodes('table')
它掉到一张桌子上,虽然我可以看到至少有 8 个,都包裹在 div.table-responsive 中,但是在尝试列出它们时
page %>%
html_nodes('div.table-responsive')
html_nodes('table') %>%
我仍然返回一个表 ({xml_nodeset (1)}),它不是我感兴趣的任何可见表。
所以问题是:我如何在此页面上列出所有包含候选人姓名/职业和隶属关系的表格,和/或如何抓取它们。
【问题讨论】: