【发布时间】:2017-05-02 22:26:22
【问题描述】:
我的问题的说明
处理每小时变化的时间序列数据,其中包含从 2016-01-01 00:00 到 2016-01-07 23:00 的日期时间以及与每个时间范围相对应的一些特征。
理想情况下,将有 7 x 24 行数据覆盖所有时间段。但有时,每小时数据可能会因某种原因中断(例如捕获每小时的天气信息,但网站在特定时间中断。)
我的数据框现在包含所有相同的数据而不会丢失小时。我的数据框的长度是 7 * 24 - 5,这意味着有 5 个小时数据丢失。
日期时间以201601010100的格式保存,代表2016-01-01 01:00:00
我的尝试。
我尝试生成长度为 7*24 的新数据帧,其中包含连续的每小时日期时间
data = {"datetime":[],"feature1":[],"feature2":[]}
ff = pd.DataFrame(data)
rng = pd.date_range('01/01/2016', periods=600, freq='H')
new_date = list(rng.strftime('%Y%m%d%H'))
ff['datetime'] = new_date
原始数据框为df,其中包含datetime、feature1、feature2。
我尝试了 f3 = ff.merge(df, on ='dataframe'')。
但是 f3 仍然是 7*24 的长度。
我的目标
由于实际的时间覆盖和特征维度大,我不想循环两个数据帧并一一比较它们的 datetime.values。
我想根据df中相同的日期时间替换ff中feature的值,并保持NaN信息不变。
【问题讨论】:
标签: python python-2.7 datetime pandas missing-data