【问题标题】:Sparse data with many labels具有许多标签的稀疏数据
【发布时间】:2019-01-03 02:47:36
【问题描述】:

我有这个数据集,我必须在其中预测客户是否会给出第二个订单,如果他已经订购了他的第一个订单,如果是,那么客户将在他的第一个订单后多少天再下一个订单?在训练数据中,如果客户没有下另一个订单,它的标签是 N(意思是没有订单),如果它在 180 天后下一个订单,它的标签是 L(意思是长)。如果第二个订单介于 0 到 180 天之间,则其标签是第一个订单和第二个订单之间的天数。(例如 13、27、45、60、135 等)。我必须准确地预测客户将下一个订单的天数或(N- 无订单和 L- 180 天后订单)。功能只是包含 646 列的 1 和 0'(稀疏数据)。

首先我很困惑这是什么问题。似乎是分类和回归问题的混合体。1st我必须分类它是否属于N,L或0-180天之间。然后如果顺序在 0-180 天之间,我必须预测 确切 客户将下一个订单的天数。如果我的想法是正确的,我的方法应该是什么。欢迎提出任何其他建议。

PS:有 7474 行和 646 列包含 0 和 1 的稀疏数据

【问题讨论】:

  • 我建议你把这个问题发到datascience.stackexchange.com。 StackOverflow 应该与编程相关,而据我所知,这个问题与现在的数据科学领域更相关。

标签: machine-learning classification regression sparse-matrix


【解决方案1】:

就我个人而言,我会先做一个简单的分类。 在这种情况下,您尝试从长期/不购买的客户中“清除”短期重新订购。

确保您在这些类别中合理分配,以获得不错的结果。

之后,您可以开始查看只有特定日期的数据,然后对该子集执行回归。

至于维度的稀疏性,您可以尝试降维,例如使用 PCA 或 LDA,以获得更好的数据表示,并且不会浪费不必要的资源(您也可以使用嵌入层,例如)。

【讨论】:

    猜你喜欢
    • 2023-03-16
    • 2015-11-15
    • 2020-08-31
    • 1970-01-01
    • 2021-07-17
    • 1970-01-01
    • 2010-11-18
    • 1970-01-01
    相关资源
    最近更新 更多