【问题标题】:How can I use ddply with varying .variables?如何将 ddply 与不同的 .variables 一起使用?
【发布时间】:2012-01-17 16:12:34
【问题描述】:

我用ddply总结了一些data.frameby各个类别,像这样:

# with both group and size being factors / categorical
split.df <- ddply(mydata,.(group,size),summarize,
                  sumGroupSize = sum(someValue))

这很顺利,但我经常喜欢计算比率,这意味着我需要除以组的总数。如何在同一个 ddply 调用中计算这样的总数?

假设我想在 A 组中获得大小为 1 的观察值的份额。显然,我必须首先计算大小为 1 的所有观察值的总和。 当然,我可以通过两个 ddply 调用来做到这一点,但使用所有一个调用会更舒服。有没有办法这样做?

编辑: 我并不想问得过于具体,但我意识到我在这里打扰了人们。所以这是我的具体问题。事实上,我确实有一个有效的例子,但我认为它并不漂亮。另外,它还有一个我需要克服的缺点:它不能与 apply 一起正常工作。

library(plyr)

# make the dataset more "realistic"
mydata <- warpbreaks
names(mydata) <- c("someValue","group","size")
mydata$category <- c(1,2,3)
mydata$categoryA <- c("A","A","X","X","Z","Z")
# add some NA
mydata$category[c(8,10,19)] <- NA
mydata$categoryA[c(14,1,20)] <- NA


# someValue is summarized !
# note we have a another, varying category hence we need the a parameter
calcShares <- function(a, data) {
# !is.na needs to be specific!
tempres1 <- eval(substitute(ddply(data[!is.na(a),],.(group,size,a),summarize,
                sumTest = sum(someValue,na.rm=T))),

                envir=data, enclos=parent.frame())
tempres2 <- eval(substitute(ddply(data[!is.na(a),],.(group,size),summarize,
                sumTestTotal = sum(someValue,na.rm=T))),
                envir=data, enclos=parent.frame())

res <- merge(tempres1,tempres2,by=c("group","size"))
res$share <- res$sumTest/res$sumTestTotal
 return(res)

}

test <- calcShares(category,mydata)
test2 <- calcShares(categoryA,mydata)   
head(test)
head(test2)

如您所见,我打算在不同的分类变量上运行它。在示例中,我只有两个(类别,类别 A),但实际上我得到了更多,因此将 apply 与我的函数一起使用会非常好,但不知何故它无法正常工作。

applytest <- head(apply(mydata[grep("^cat",
             names(mydata),value=T)],2,calcShares,data=mydata))   

.. 为类别 var 返回一条警告消息和一个奇怪的名称 (newX[, i] )。

那么我该如何做到这一点 a) 更优雅 b) 解决应用问题?

【问题讨论】:

  • 很好的问题。我总是像你说的那样将 ddply 包裹在另一个 ddply 中,所以我也对这个问题的解决方案感兴趣。 table + prop.table + addmargins 会为你工作,还是你需要 ddply 的额外灵活性?
  • 你不会使用count 函数吗?我的记忆是,它只是 length 的重命名,需要在基础 R 中与 ave 一起使用。
  • 嗯。很好,不知道 prop.table,但我仍然可以利用 ddply 的灵活性。
  • @DWin 但是,当您想要的总数超过 ddply 目前必须使用的 grouplevel1:sizelevel1 的一小部分时,该怎么办?就像这个例子一样,我们想要 sizelevel1 的整个计数来计算比例。我认为这就是 ran2 想要的,为此我总是必须执行两次 ddply 传递,或者更简单地使用 table 系列函数。

标签: r plyr


【解决方案1】:

这看起来很简单,所以我可能遗漏了您问题的某些方面。

首先,定义一个函数来计算group 的每个级别中所需的值。然后,不要使用.(group, size) 拆分data.frame,而是使用.(group),并将新定义的函数应用于每个拆分片段。

library(plyr)

# Create a dataset with the names in your example
mydata <- warpbreaks
names(mydata) <- c("someValue", "group", "size")

# A function that calculates the proportional contribution of each size class 
# to the sum of someValue within a level of group
getProps <- function(df) {
    with(df, ave(someValue, size, FUN=sum)/sum(someValue))
}

# The call to ddply()
res <- ddply(mydata, .(group), 
             .fun = function(X) transform(X, PROPS=getProps(X)))

head(res, 12)
#    someValue group size     PROPS
# 1         26     A    L 0.4785203
# 2         30     A    L 0.4785203
# 3         54     A    L 0.4785203
# 4         25     A    L 0.4785203
# 5         70     A    L 0.4785203
# 6         52     A    L 0.4785203
# 7         51     A    L 0.4785203
# 8         26     A    L 0.4785203
# 9         67     A    L 0.4785203
# 10        18     A    M 0.2577566
# 11        21     A    M 0.2577566
# 12        29     A    M 0.2577566

【讨论】:

  • +1 带来了一些新鲜的想法(使用 / ave / transform)。我意识到,我有点不精确,并发布了一个更具体的可重现示例。您的解决方案缺少的是摘要(即聚合)。但也许您可以以某种方式将其添加到您的解决方案中。我不只关注 ddply :)
  • 我也喜欢这个,但我不知道它是否比从一开始就做 2x ddply 更简单。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2017-04-29
  • 2017-05-24
  • 2019-08-20
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2021-09-21
相关资源
最近更新 更多