【发布时间】:2018-03-07 19:40:45
【问题描述】:
我有一个数据集,其中包含交易的时间戳,格式为 26-09-2017 15:29:32。我需要找到销售的可能相关性和预测(比如说逻辑回归)。我的问题是:
- 如何处理日期格式?我应该把它转换成一个数字吗(就像excel自动做的那样)?我应该把它分成更多的变量,比如日、月、年、小时、分钟、秒吗?还有其他可能的建议吗?
- 如果我想每年添加不同的周数怎么办?我应该添加像 342017(2017 年第 34 周)这样的变量吗?
- 我应该为问题 2 做同样的季度吗?
# Datetime Gender Purchase 1 23/09/2015 00:00:00 0 1 2 23/09/2015 01:00:00 1 0 3 25/09/2015 02:00:00 1 0 4 27/09/2015 03:00:00 1 1 5 28/09/2015 04:00:00 0 0
【问题讨论】:
-
这个问题非常广泛。 1)其次选择一种语言(R或Python)。 2)询问我们如何/最好的方式来处理您的数据不是这个网站的目的,这会引起太多的意见。 3) 要求一本书、工具、参考资料也是该网站的题外话。请查看这篇文章,了解什么适合 SO。 stackoverflow.com/help/on-topic
-
感谢您的快速回复。问题对于机器学习问题非常具体,我问的是人们如何对待这类问题。标记 R 和 Python 的原因是因为可能有一些包可以帮助克服数据转换的障碍
-
我理解你的问题,以及它在建模中的重要性。但这不是编程问题,即您没有代码、错误、不正确/意外/不一致的结果/输出。你甚至没有谈论你正在用你的预期输出/目标训练什么样的算法。如果您想讨论机器学习/建模的各种日期表示的优缺点,我建议Datascience Stackexchange
-
其实我有。我说的是逻辑回归。事实上,我的第四个问题是题外话,我感谢你。不过,您对我的其余问题有什么贡献吗?例如如果我可以使用数字 42270 而不是 23/09/2015 00:00:00 会更好吗?我要添加另一个变量来显示吗?日期名称?
-
首先,R 和 python 以人类可读的格式显示日期,但在内部将它们表示为从原始时间开始的秒或分钟或天(例如 1970-01-01)。您可以将日期列表示为星期几、季度 (1:4)、星期 (1:52)、主要假期的时间、上一次满月的时间、月份中的某一天、一年中的某一天 (1:365 ) 销售之间的时间、季节、从销售或促销开始的时间等等等等。真正的问题是你想如何解释你的模型变量?最后,R 和 python 有一些包可以让处理日期变得非常容易。
标签: python r machine-learning logistic-regression feature-selection