【发布时间】:2023-02-22 01:31:46
【问题描述】:
我有一组纬度/经度点,每个点都附有数值。本质上,我想对每个点 300,000 米以内的数值进行基本计算,但最初只是尝试对这些值求和,因为我应该能够弄清楚如何从那里进行更复杂的计算。此外,数据集很大(约 200,000 行),这似乎是当前的瓶颈。
我目前有以下内容:
library(sf)
library(dplyr)
library(units)
test <-data.frame(Longitude=rnorm(2e5),Latitude=rnorm(2e5),ncol=runif(2e5, min=0, max=100))
pt = st_as_sf(x = test,coords = c("Longitude","Latitude"),crs = 4326)
st_distance(pt,pt[1,])<set_units(300000,m)
我的逻辑是为每一行找到半径内的其他行,然后使用此信息对这些行进行过滤(和求和)。然而,考虑到数据量,我似乎遇到了困难,我也不确定这是最有效的方法。
任何帮助,将不胜感激。
【问题讨论】:
-
有多种方法可以做到这一点,但是您能否更清楚地说明您的要求? m 个点的原始距离矩阵将是 m^2 个值,这在这里太大了。如果您要创建 >n 米的布尔矩阵,您的点需要一个 ID。您似乎没有 - 您有一个名为
ncol的列,它是一个随机浮点数 - 这意味着定义列数吗?是身份证吗?您希望输出看起来像什么?你能举个5分之类的例子吗? -
@SamR ncol 只是分配给每个点的随机数值。因此,例如,我想对测试数据帧中所有点的 ncol 值求和,这些点在第一个点的 300,000m 以内,然后是第二个点等。因此,理想的输出只是带有附加列的测试数据帧显示该行 300,000 米范围内所有点的聚合 ncol 值。我目前无法编辑问题,但会在可能的情况下更新示例。
标签: r dplyr mapping geospatial sf