【发布时间】:2021-01-30 13:47:54
【问题描述】:
如果我想通过我目前拥有的传感器对数据集应用深度学习,我需要大量数据,否则我们可能会看到过度拟合。不幸的是,传感器只活跃了一个月,因此数据需要扩充。我目前有数据框形式的数据,如下所示:
index timestamp cas_pre fl_rat ...
0 2017-04-06 11:25:00 687.982849 1627.040283 ...
1 2017-04-06 11:30:00 693.427673 1506.217285 ...
2 2017-04-06 11:35:00 692.686310 1537.114807 ...
....
101003 2017-04-06 11:35:00 692.686310 1537.114807 ...
现在我想用tsaug package 扩充一些特定的列。增强的形式可以是:
my_aug = (
RandomMagnify(max_zoom=1.2, min_zoom=0.8) * 2
+ RandomTimeWarp() * 2
+ RandomJitter(strength=0.1) @ 0.5
+ RandomTrend(min_anchor=-0.5, max_anchor=0.5) @ 0.5
)
扩充库的文档继续以下列方式使用扩充:
X_aug, Y_aug = my_aug.run(X, Y)
在对this 站点的进一步调查中,增强似乎影响了 numpy 数组。虽然它声明它是一种多变量增强,但不确定它是如何有效地发生的。
我想在 cas_pre 和 fl_rat 等浮点数值列中应用这种一致的扩充,以免与原始数据和每列之间的关系偏离太多。我不想应用它像timestamp 这样的行。我不确定如何在 Pandas 中执行此操作。
【问题讨论】:
-
您能否共享一个示例数据集(所有列,但只有几行)?我并不是特别了解时间序列增强,但我认为它会创建新的假样本 - 所以需要与这些相关的新时间戳?
标签: python pandas dataframe time-series data-augmentation