【发布时间】:2018-11-30 04:43:36
【问题描述】:
我正在与 R 合作,为我作为记者的工作抓取和清理数据。我可以获取 HTML 表格,然后将其作为数据框读取并重命名列的名称。现在我正在尝试创建一个新列,该列会考虑其他列的值来获取值。
这个新列应该获得“Avante”、“DEM”、“MDB”、“Patriota”、“PCdoB”等值。这是每个代表的党。例如,Avante 有三名副手,分别是“Adalberto Cavalcanti”、“Cabo Sabino”和“Silvio Costa”。代表的名字总是排在党名的下方。
url <- "http://www.camara.leg.br/internet/votacao/mostraVotacao.asp?ideVotacao=8559&numLegislatura=55&codCasa=1&numSessaoLegislativa=4&indTipoSessaoLegislativa=O&numSessao=225&indTipoSessao=E&tipo=partido"
library(xml2)
library(rvest)
file <- read_html(url)
tables <- html_nodes(file, "table")
table1 <- html_table(tables[3], fill = TRUE, header = T)
head(table1)
table1_df <- as.data.frame(table1)
colnames(table1_df) <- c("deputado", "uf", "voto")
这就是我现在拥有的: enter image description here
这就是我想要的: enter image description here
【问题讨论】:
-
不清楚你想要什么。你能显示几行预期的输出吗
-
好的,我刚刚添加了我所拥有的以及我正在尝试做的事情的图片。
标签: r dplyr tidyverse rvest data-cleaning