【发布时间】:2017-11-02 22:29:49
【问题描述】:
我如何考虑取几个不同平均值的平均值?
这是一些数据:
library(dplyr)
month <- c("January", "January","January", "February", "March", "April", "April", "May", "June", "July")
year <- c(2014, 2014, 2014, 2014, 2014, 2014, 2014, 2014, 2014, 2014)
v1 <- c(0, 1, 0, 1, 0, 0, 1, 0, 1, 1)
df <- data.frame(month, year, v1)
如您所见,我在不同月份有不同的样本量。一月的样本量为 3,四月的样本量为 2,以此类推
我可以取他们每个人的平均值,每个月取一个平均值:
df %>% group_by(year, month) %>% summarize_all(mean)
但是,我如何获得 2014 年的正确平均值,因为我有几个月的平均值,其中每个月的平均值都有不同的样本量?
【问题讨论】:
-
这是一个统计问题吗?你只是
group_by(year)假设每一行都是一个样本,因为它出现在你的数据中。或者,您可以使用weighted.mean() -
是的,我想这是一个统计问题。鉴于每月平均值是用不同的样本量创建的,我不确定它是否需要任何加权。
-
通过在交叉验证上发帖,您更有可能获得有关统计问题的帮助:stats.stackexchange.com