【发布时间】:2017-03-25 11:12:54
【问题描述】:
我在xarray 中有一个数据集,具有以下维度:
Dimensions: (subject: 30, session: 5, time: 45000)
Coordinates:
* subject (subject) object '110' '112' '114' '117' ...
* session (session) object 'week1' 'week2' 'week3' ...
* time (time) timedelta64[ns] 00:00:00 00:00:00.040000 ...
我想将每个试验(主题/会话组合)分成更小的时间段,例如分成 3 段,每段 15000 个值,生成的维度可能如下所示:
(subject: 30, session: 5, segment: 3, time: 15000)
我已经搜索并尝试了很多东西,但都没有成功,如何做到这一点?
我一直在尝试的一件事似乎很接近,是创建一个新的 MultiIndex 并将其拆开。
segment_data = np.repeat(range(3),len(ds.time)//3)
segment = xr.Variable(dims='time',data=segment_data)
newtime_data = np.tile(ds.time[:len(ds.time)//3],3)
newtime = xr.Variable(dims='time',data=newtime_data)
dsr = ds.assign_coords(segment=segment,newtime=newtime)
dsr = dsr.set_index(segment='segment',newtime='newtime')
dsr = dsr.stack(fragment=['segment','newtime'])
但是最后一行占用了大量内存,并且似乎创建了一个维度fragment: len(ds.time)**2,这似乎不太正确。我也不确定在此之后我需要做什么 (unstack('fragment')?)。
编辑:更多尝试将我带到这里:
x = np.repeat(range(3),15000)
y = np.tile(ds.time[:len(ds.time)//3],3)
dsr = (ds.assign_coords(segment=x,time2=y)
.set_index(fragment=['segment','time2'])
.unstack('fragment'))
这给出了这个:
(subject: 30, segment: 3, session: 5, time: 45000, time2: 15000)
这似乎很接近,但并不完全存在,因为每个 time2 点现在都有 45000 个值,而它应该是一个值:
dsr.isel(subject=0,segment=0,session=0,time2=0)
# (time: 45000)
编辑:我终于找到了一种方法,请参阅我的答案。欢迎提出更多建议!
【问题讨论】:
标签: python python-datetime python-xarray