【问题标题】:Aggregating points in dataframe based on distance根据距离聚合数据框中的点
【发布时间】:2023-02-22 01:31:46
【问题描述】:

我有一组纬度/经度点,每个点都附有数值。本质上,我想对每个点 300,000 米以内的数值进行基本计算,但最初只是尝试对这些值求和,因为我应该能够弄清楚如何从那里进行更复杂的计算。此外,数据集很大(约 200,000 行),这似乎是当前的瓶颈。

我目前有以下内容:

library(sf)
library(dplyr)
library(units)

test <-data.frame(Longitude=rnorm(2e5),Latitude=rnorm(2e5),ncol=runif(2e5, min=0, max=100))
pt = st_as_sf(x = test,coords = c("Longitude","Latitude"),crs = 4326)
st_distance(pt,pt[1,])<set_units(300000,m)

我的逻辑是为每一行找到半径内的其他行,然后使用此信息对这些行进行过滤(和求和)。然而,考虑到数据量,我似乎遇到了困难,我也不确定这是最有效的方法。

任何帮助,将不胜感激。

【问题讨论】:

  • 有多种方法可以做到这一点,但是您能否更清楚地说明您的要求? m 个点的原始距离矩阵将是 m^2 个值,这在这里太大了。如果您要创建 >n 米的布尔矩阵,您的点需要一个 ID。您似乎没有 - 您有一个名为 ncol 的列,它是一个随机浮点数 - 这意味着定义列数吗?是身份证吗?您希望输出看起来像什么?你能举个5分之类的例子吗?
  • @SamR ncol 只是分配给每个点的随机数值。因此,例如,我想对测试数据帧中所有点的 ncol 值求和,这些点在第一个点的 300,000m 以内,然后是第二个点等。因此,理想的输出只是带有附加列的测试数据帧显示该行 300,000 米范围内所有点的聚合 ncol 值。我目前无法编辑问题,但会在可能的情况下更新示例。

标签: r dplyr mapping geospatial sf


【解决方案1】:

也许你可以尝试使用 st_buffer(),它创建一个具有给定半径的圆,然后使用 st_intersect() 来过滤其中的点。我的意思是,尝试:

library(sf)
library(tidyverse)
library(units)

test <-data.frame(Longitude=rnorm(2e5),Latitude=rnorm(2e5),ncol=runif(2e5, min=0, max=100))
pt = st_as_sf(x = test,coords = c("Longitude","Latitude"),crs = 4326)

st_intersects(I(st_buffer(pt[1,], set_units(300000,m)))$geometry,pt %>% rowwise) 
# Here, it took around 10s to run

【讨论】:

  • 实际上,大约 8.4 秒。我建议您使用 for 结构并仅查看新点,使用您已经完成的操作(例如,如果点 1 和点 10 在 300 公里以内,您知道 10 和 1 在 10 公里以内并且不不需要重新计算)
猜你喜欢
  • 1970-01-01
  • 2018-05-18
  • 1970-01-01
  • 2018-12-26
  • 1970-01-01
  • 2018-09-17
  • 1970-01-01
  • 1970-01-01
  • 2019-04-27
相关资源
最近更新 更多