【问题标题】:The algorithm behind tsfresh select_features methodtsfresh select_features 方法背后的算法
【发布时间】:2020-01-31 04:22:06
【问题描述】:
我最近开始使用tsfresh 库从时间序列数据中提取特征。
我可以在几行代码中获得功能包,这非常酷,但我对 select_features 方法背后的逻辑持怀疑态度。我查看了官方文档并搜索了它,但我找不到用于此的算法。我想知道它是如何工作的,以便我可以决定在tsfresh中数据处理后的特征选择阶段做什么。
【问题讨论】:
标签:
python
time-series
feature-extraction
feature-selection
【解决方案1】:
根据that page 在他们的文档中,他们所做的是:
- 他们提取了一整套特征
- 他们单独测试不同特征的重要性(在监督设置中,因此测试类似于“此特征对预测输出有用吗?”)并使用称为 Benjamini-Yekutieli 程序的程序保留最重要的特征
他们提供的参考资料应该很有趣:
[1] Christ, M., Kempa-Liehr, A.W.和 Feindt, M. (2016)。面向工业大数据应用的分布式并行时间序列特征提取。 ArXiv 电子版:1610.07717 网址:http://adsabs.harvard.edu/abs/2016arXiv161007717C
[2] Benjamini, Y. 和 Yekutieli, D. (2001)。依赖关系下多次测试中错误发现率的控制。统计年鉴,1165–1188
其中 [1] 是描述 tsfresh 的论文,[2] 是多重测试程序(上面称为 Benjamini-Yekutieli 程序)的参考。