【发布时间】:2011-04-28 00:17:16
【问题描述】:
我有两个不同的时间序列,其中部分重叠的时间戳:
import scikits.timeseries as ts
from datetime import datetime
a = ts.time_series([1,2,3], dates=[datetime(2010,10,20), datetime(2010,10,21), datetime(2010,10,23)], freq='D')
b = ts.time_series([4,5,6], dates=[datetime(2010,10,20), datetime(2010,10,22), datetime(2010,10,23)], freq='D')
代表以下数据:
Day: 20. 21. 22. 23.
a: 1 2 - 3
b: 4 - 5 6
我想用系数 a(0.3) 和 b(0.7) 计算每天的加权平均值,同时忽略缺失值:
Day 20.: (0.3 * 1 + 0.7 * 4) / (0.3 + 0.7) = 3.1 / 1. = 3.1
Day 21.: (0.3 * 2 ) / (0.3 ) = 0.6 / 0.3 = 2
Day 22.: ( 0.7 * 5) / ( 0.7) = 3.5 / 0.7 = 5
Day 23.: (0.3 * 3 + 0.7 * 6) / (0.3 + 0.7) = 3.1 / 1. = 5.1
当我第一次尝试对齐这些时间序列时:
a1, b1 = ts.aligned(a, b)
我得到正确屏蔽的时间序列:
timeseries([1 2 -- 3],
dates = [20-Oct-2010 ... 23-Oct-2010],
freq = D)
timeseries([4 -- 5 6],
dates = [20-Oct-2010 ... 23-Oct-2010],
freq = D)
但是当我执行a1 * 0.3 + b1 * 0.7 时,它会忽略仅存在于一个时间序列中的值:
timeseries([3.1 -- -- 5.1],
dates = [20-Oct-2010 ... 23-Oct-2010],
freq = D)
我应该怎么做才能收到等待的?
timeseries([3.1 2. 5. 5.1],
dates = [20-Oct-2010 ... 23-Oct-2010],
freq = D)
编辑:答案应该也适用于两个以上具有不同权重和不同缺失值的初始时间序列。
因此,如果我们有四个权重为 T1(0.1)、T2(0.2)、T3(0.3) 和 T4(0.4) 的时间序列,它们在给定时间戳的权重将为:
| T1 | T2 | T3 | T4 |
weight | 0.1 | 0.2 | 0.3 | 0.4 |
-------------------------------------
all present | 10% | 20% | 30% | 40% |
T1 missing | | 22% | 33% | 45% |
T1,T2 miss. | | | 43% | 57% |
T4 missing | 17% | 33% | 50% | |
etc.
【问题讨论】:
-
“超过两个初始时间序列”?你是说T1、T2、T3?不就是 ((T1 agg T2) agg T3) 吗?在这种情况下,可以通过简单地应用解决方案来聚合任意数量的时间序列。如果没有,为什么不呢?
-
@S.Lott - 不是真的。您将如何处理 T1(0.2)、T2(0.2) 和 T3(0.6) 的权重?如果在给定的时间戳 T1 缺失,则 T3 的 0.6 实际上代表 75%(T2 有 25%),而不是整个组的 60%。在您的 ((T1 agg T2) agg T3) 逻辑中,这是行不通的。
-
@eumiro:请根据此要求更新您的问题。
-
@S.Lott - 我希望很清楚。
-
@eumiro:为什么你的评论很详细,而问题又不是很详细?请更新您的问题完整。
标签: python datetime weighted-average scikits time-series