【发布时间】:2018-08-30 23:26:10
【问题描述】:
我在内存中有一个大数据集,大约有 400k 行。处理这个数据帧的一个子集,我想生成一个大图像,并根据数据帧中的条目将该图像中的元素设置为等于特定值。我使用for 循环非常简单地做到了这一点,无疑是愚蠢的:
library('Matrix')
#saveMe is a subset of the dataframe containing the x-ranges I want
#in columns 1,2; y-ranges in 3-4, and values in 5.
saveMe<-structure(list(XMin = c(1, 17, 19, 19, 21, 29, 29, 31, 31, 31, 31, 33, 33, 35, 37, 39, 39, 39, 41, 43), XMax = c(9, 15, 1, 3,1, 17, 37, 5, 13, 25, 35, 17, 43, 23, 47, 25, 25, 33, 21, 29), YMin = c(225, 305, 435, 481, 209, 1591, 157, 115, 1, 691, 79, 47, 893, 1805, 809, 949, 2179, 1733, 339, 739), YMax = c(277,315, 435, 499, 213, 1689, 217, 133, 1, 707, 111, 33, 903,1827, 849, 973, 2225, 1723, 341, 765), Value = c(3, 1, 0,1, 1, 4, 3, 1, 1, 0, 2, 1, 1, 0, 2, 1, 1, 2, 0, 0)), .Names = c("XMin", "XMax", "YMin", "YMax", "Value"),class = c("data.table", "data.frame"), row.names = c(NA, -20L))
#Create sparse matrix to store the result:
xMax <- max(saveMe$XMax) - min(saveMe$XMin)+1
yMax <- max(saveMe$YMax) - min(saveMe$YMin)+1
img<-Matrix(0, nrow = xMax, ncol = yMax, sparse = TRUE)
for (kx in 1:nrow(saveMe)) {
img[as.numeric(saveMe[kx,1]):as.numeric(saveMe[kx,2]), as.numeric(saveMe[kx,3]):as.numeric(saveMe[kx,4])] <- as.numeric(saveMe[kx,5])
}
nnzero(img)
image(img)
这需要真的很长时间——大约五个小时——而且是愚蠢的,逐行迭代。我知道通常可以使用 apply 来大大加快速度。因此,正如您所期望的那样,我已经尝试过这样做:
img<-Matrix(0, nrow = xMax, ncol = yMax, sparse = TRUE)
apFun <- function(x, imToUse){
#idea is to then change that to something like...
imToUse[(x[1]:x[2]), (x[3]:x[4]) ] <- x[5]
}
apply(as.matrix(saveMe), 1, apFun,imToUse=img);
nnzero(img)
image(img)
但是,无论我尝试什么,img 中的结果元素始终为零。我认为这可能是一个变量范围问题。我究竟做错了什么?
顺便说一句,我真正想要解决的问题是为这些数据创建一个整数“稀疏图像”,其中除了由[XMin XMax YMin YMax] 界定的矩形中的元素之外,所有元素都为零等于value(即x[5])。有没有更好的方法来做到这一点?
【问题讨论】:
-
Sathish -- 在 SE 上以可复制方式显示数据框的好方法是什么?
-
见下面的编辑。我添加了我的总体建议和一些基准,以便为您提供一些数据:如何提高效率。
标签: r syntax large-data