【发布时间】:2020-02-17 10:20:48
【问题描述】:
数据集包含: 15000 次观察/行 3000 个特征/列
我可以在这些数据集上训练机器学习模型吗
【问题讨论】:
-
很多特征并不总是意味着会有过拟合。但是,如果您的数据中存在多重共线性,那肯定会导致过度拟合。因此,仅通过查看数据的维度是无法判断的。
-
有 15000 个唯一 ID,每个 ID 有一个事务 Features.i-eID1 有 10 个事务。每个事务有 30 个特性。所以我创建了一个包含 10*30 的单行 - > 300 列/功能。
-
类似地,ID2 有 100 个事务,每个事务有 30 个参数。所以我创建了一个包含 3000 个特征的 ID2。
-
找到的任何 ID 的最大事务数为 100 。因此 100*30 ->3000 个特征
-
欢迎来到SO,这是关于具体编码的问题;你的问题太宽泛了,请花点时间阅读How to Ask 和What topics can I ask about here?。另外,cmets 不适合添加此类信息 - 请改为编辑和更新您的帖子。
标签: python machine-learning deep-learning dataset random-forest