【发布时间】:2019-01-06 13:11:53
【问题描述】:
我正在尝试预测 t+5 时的比特币价格,即提前 5 分钟,使用截至时间 t 的 11 个技术指标,这些指标都可以从比特币时间的开盘价、最高价、最低价、收盘价和成交量值计算出来系列(见我的完整数据集here)。据我所知,在使用回归树、支持向量机或人工神经网络等算法时,不需要操作数据框,但在使用随机森林 (RF) 和 Boosting 等集成方法时,我听说有必要以某种方式重新排列数据帧,因为集成方法从训练数据中抽取重复的随机样本,在这种情况下,比特币时间序列的序列将被破坏。那么,有没有办法以某种方式重新排列数据帧,使得每次从训练数据中抽取重复样本时,时间序列仍将按时间顺序排列?
向我提供了有关如何构造数据框 here 和可能还有 here 的解释,但不幸的是,我并没有真正理解这些解释,因为我没有看到待构建的数据框,因为我无法识别相关的代码行。因此,如果有人可以向我展示如何使用示例数据框重新排列数据框,我将非常感激。作为示例数据框,您可以考虑使用 r 中的airquality 内置数据框(我认为它包含时间序列数据)、我在上面提供的数据或您认为最好的任何其他数据框。
非常感谢!
【问题讨论】:
标签: r dataframe time-series random-forest ensemble-learning