【发布时间】:2015-08-29 08:00:14
【问题描述】:
我不确定这是否适合提问,如果这听起来无关紧要,请原谅我。这是我的情况:
我的数据集及时为continual,我需要处理一些errones data。相对于他们的邻居,他们的价值突然增加。
这是数据集的一部分。如您所见,第 4 个值(28.3)突然增加。 (数值在最后一列)
19741212,0700,200,1,N, 4.6
19741212,0800,190,1,N, 4.6
19741212,0900,180,1,N, 5.7
19741212,1000,160,1,N, 28.3 # wrong data, need interpolate from neighbors
19741212,1100,170,1,N, 4.6
19741212,1200,200,1,N, 5.1
19741212,1300,230,1,N, 5.1
我需要identify他们,然后从附近的数据中做interpolate来替换他们。我想知道是否有任何现有的algorithm 用于此?
如果我要从头开始实现一个方法,我会受伤:
- 从附近的数据点计算增量
- 为检测损坏的数据选择一个合适的阈值
但我不确定这是否足够好,也许我忽略了其他部分,这会导致大量误报。
另外,我正在使用Python 和Pandas 来处理数据,所以相关资源会很棒。
【问题讨论】: