【发布时间】:2012-03-01 14:00:38
【问题描述】:
假设我一直在使用笔记本电脑上的 3g 调制解调器和 GPS 驾驶设定的路线,而我在家里的电脑记录了 ping 延迟。我已将 ping 与 GPS 纬度/经度相关联,现在我想可视化这些数据。
我每天有大约 80,000 个数据点,我想展示几个月的数据。我对显示 ping 始终超时的区域(即 ping == 1000)特别感兴趣。
散点图
我的第一次尝试是使用散点图,每个数据输入一个点。如果超时,我将点的大小放大 5 倍,因此这些区域的位置很明显。我还将 alpha 降低到 0.1,以粗略地查看重叠点。
# Colour
c = pings
# Size
s = [2 if ping < 1000 else 10 for ping in pings]
# Scatter plot
plt.scatter(longs, lats, s=s, marker='o', c=c, cmap=cm.jet, edgecolors='none', alpha=0.1)
这样做的明显问题是每个数据点显示一个标记,这是显示大量数据的一种非常糟糕的方式。如果我两次驶过同一区域,那么第一次通过的数据只会显示在第二次通过的顶部。
在偶数网格上插值
然后我尝试使用 numpy 和 scipy 在偶数网格上进行插值。
# Convert python list to np arrays
x = np.array(longs, dtype=float)
y = np.array(lats, dtype=float)
z = np.array(pings, dtype=float)
# Make even grid (200 rows/cols)
xi = np.linspace(min(longs), max(longs), 200)
yi = np.linspace(min(lats), max(lats), 200)
# Interpolate data points to grid
zi = griddata((x, y), z, (xi[None,:], yi[:,None]), method='linear', fill_value=0)
# Plot contour map
plt.contour(xi,yi,zi,15,linewidths=0.5,colors='k')
plt.contourf(xi,yi,zi,15,cmap=plt.cm.jet)
这看起来很有趣(很多颜色和形状),但它在我没有探索过的区域外推得太远了。你看不到我走过的路线,只有红色/蓝色斑点。
如果我在一条大曲线上行驶,它会在之间的区域内插值(见下文):
在不均匀的网格上插值
然后我尝试使用 meshgrid (xi, yi = np.meshgrid(lats, longs)) 而不是固定网格,但有人告诉我我的数组太大了。
有没有一种简单的方法可以从我的点创建一个网格?
我的要求:
- 处理大型数据集(80,000 x 60 = ~5m 点)
- 通过平均(我假设插值会这样做)或通过为每个点取最小值来显示每个点的重复数据。
- 不要从数据点推断太远
我对散点图(顶部)很满意,但我需要一些方法在显示之前对数据进行平均。
(对于不可靠的 mspaint 图纸,我无法上传实际数据表示歉意)
解决方案:
# Get sum
hsum, long_range, lat_range = np.histogram2d(longs, lats, bins=(res_long,res_lat), range=((a,b),(c,d)), weights=pings)
# Get count
hcount, ignore1, ignore2 = np.histogram2d(longs, lats, bins=(res_long,res_lat), range=((a,b),(c,d)))
# Get average
h = hsum/hcount
x, y = np.where(h)
average = h[x, y]
# Make scatter plot
scatterplot = ax.scatter(long_range[x], lat_range[y], s=3, c=average, linewidths=0, cmap="jet", vmin=0, vmax=1000)
【问题讨论】:
-
我建议对数据进行聚类,即组合一定距离内的点并在散点图中显示它们的平均值/最小值。话虽如此,我对python中的集群算法了解不多,但我相信你可以很容易地在google上找到一些想法。
标签: python numpy matplotlib scipy interpolation