【发布时间】:2017-11-26 05:06:04
【问题描述】:
我有一个数据框df,其中包含三列item、store 和week。它看起来像这样:
item store week
24128 272568 1203
25554 272568 1203
24177 272568 1203
72000 272568 1203
72001 272568 1203
24128 272568 1204
25554 272568 1204
24177 272568 1204
72000 272568 1204
72001 272568 1204
----- ------ ----
24128 272569 1203
25554 272569 1203
24177 272569 1203
72000 272569 1203
72001 272569 1203
24128 272569 1204
25554 272569 1204
24177 272569 1204
72000 272569 1204
72001 272569 1204
我想看看每个item 中存在多少store。我尝试了以下方法:
aggregate(store~item, data = df,FUN = "length")
以及doBy 包中的函数summaryBy:
summaryBy(store~item,data = df,FUN = c(length))
但是,函数 length 返回 store 的数量并进行重复计数,即,它为每个 week 计算每个 store。如何避免这种重复计算并为每个 item 获得唯一的 store 长度?
【问题讨论】: