【发布时间】:2021-12-23 10:36:15
【问题描述】:
我正在编写一个在 R 中使用 queryparser 和 tidyquery 的 SQL 教程。这一直进展顺利,直到我被要求这样做:
SELECT ... SUM(new_vaccinations) OVER (PARTITION BY location) as vaccinations_to_date
Tidyquery 报告说它不支持 OVER 函数,所以我尝试使用 dplyr 复制 OVER (PARTITION BY...) 函数。
这使我在 dplyr 中找到了with_order(order_by =...。现在我正在努力让fun = 允许我创建一个累积总和列。
library(tidyverse)
library(queryparser)
library(tidyquery)
mydf <- data.frame(date = as.Date(c("2021-06-01", '2021-06-02','2021-06-03','2021-06-04',
'2021-6-01','2021-6-02','2021-6-03','2021-6-04',
'2021-6-01','2021-6-02','2021-6-03','2021-6-04')),
location = c('United States','United States','United States','United States',
'Canada','Canada','Canada','Canada','Mexico','Mexico','Mexico','Mexico'),
new_vaccinations = c(100,98,32,50,99,34,97,53,35,101,97,56))
test <- mydf %>%
mutate (total_vax = with_order(order_by = location, fun = cumsum(new_vaccinations), x = desc(location)))
这给了我错误
could not find function "fun"
在如何重新创建OVER(PARTITION BY...) 时,我是否看错了兔子洞?如果是这样,什么是更好的选择?
还是我错过了如何正确使用with_order(order_by =...)?
如果不清楚,我的目标是创建一个新列,以保持每个单独位置的疫苗接种总数。
【问题讨论】:
-
也许我遗漏了一些东西,但我仅使用测试就按位置获得了疫苗接种的总和 % group_by(location) %>% summarise(new_vaccinations)
-
@JamesWheeler,您的目标数据如何?
-
回答 Roman 并为 @Kylie R 澄清。感谢 Simon 的回答,这就是我想要得到的答案:
test1 <- mydf %>% select(date, location, new_vaccinations) %>% group_by(location) %>% arrange(location, date) %>% mutate(new = cumsum(new_vaccinations)) %>% arrange(location, date) %>% select(date, location, new_vaccinations, new) view(test1)
标签: sql r dplyr tidyverse query-parser