【发布时间】:2019-09-13 15:16:32
【问题描述】:
长话短说:
我初始化了两个惰性 dask 数组,并希望将其包装成一个 xarray DataArray。 dask 数组有不同的长度,所以我想用 NaN 对较小的数组进行上采样,目标是共享相同的 xarray 坐标。
我怎样才能在计算上便宜(不循环每个样本)并保持 dasks 懒惰?
长篇大论:
在物理上,两个 dask 数组的值共享相同的时间维度(0s 到 5 秒),但具有完全不同的采样频率(2MHz 与 3kHz)。所以长度(=沿时间维度的形状)非常不同。
现在我希望通过让两个 dask 数组真正共享 xarray 的相同时间坐标来启用 xarray 的强大功能。
我能想到的唯一方法是在每个样本之间使用 NaN 重新采样/上采样较小的 dask 数组。
我怎样才能做到这一点?我不确定 xarrays 重新采样 [1] 或在 dask 级别重新采样是否可以帮助我。
[1]http://xarray.pydata.org/en/stable/generated/xarray.Dataset.resample.html
为简化起见,让我们保持一维并且在内存中使用非常短的数组 numpy 数组 - 实际上,源来自多个巨大的 hdf5 文件:
import dask, xarray, numpy as np
long_source = np.ones(11)
short_source = np.ones(3)
time = np.linspace(0, 5, len(long_source))
da_long = dask.array.from_array(long_source)
da_short = dask.array.from_array(long_source)
# In best case, I find a way now to resample/fill da_short with NaNs
# between every sample to be able to stack both arrays!
# So an easy shortcut would be:
da_filler = dask.array.from_array(np.full(2, np.nan))
li_conc = [da_filler, da_short[0], da_filler, da_short[1], da_filler, da_short[2], da_filler, da_short[0]]
da_short = dask.array.concatenate(li_conc)
这里 - 当然 - 出现“ValueError:所有输入数组必须具有相同数量的维度”,因为 li_conc 是一个标量并且对于这个单个项目没有形状:
[dask.array<array, shape=(2,), dtype=float64, chunksize=(2,)>,
dask.array<getitem, shape=(), dtype=float64, chunksize=()>,
dask.array<array, shape=(2,), dtype=float64, chunksize=(2,)>,
dask.array<getitem, shape=(), dtype=float64, chunksize=()>,
dask.array<array, shape=(2,), dtype=float64, chunksize=(2,)>,
dask.array<getitem, shape=(), dtype=float64, chunksize=()>,
dask.array<array, shape=(2,), dtype=float64, chunksize=(2,)>,
dask.array<getitem, shape=(), dtype=float64, chunksize=()>]
# The rest of the pseudo code would be:
final_dask_array = dask.array.stack([da_long, da_short])
xr_data = xarray.DataArray(final_dask_array , coords=[time], dims=['time', 'dataset'])
除了这种手动连接对于大型数据集肯定会变慢之外,上述方法仅在至少 2 个样本后连接时才有效。
所以想要的输出应该是这样的,在 final_dask_array.compute() 之后:
[[ 1 , 1 , 1, 1 , 1 , 1, 1, 1 , 1, 1 , 1 ],
[nan, nan, 1, nan, nan, 1, nan, nan, 1, nan, nan]]
我怎样才能做到这一点?
我真的希望,我以一种可以理解的方式描述了我的问题。 非常感谢您的帮助以及关于如何改进我的问题的建议,我将不胜感激。
【问题讨论】:
标签: python sparse-matrix dask python-xarray