【发布时间】:2020-02-21 04:39:12
【问题描述】:
有谁知道我可以如何手动划分数据而不是使用“train_test_split()”方法吗?
让我解释一下,实际上我有 3 个训练文件和 2 个测试文件,所以我想将训练文件的数据影响到 X_train 和 y_train,以及测试文件的数据到 X_test 和 y_test。
提前致谢!
【问题讨论】:
-
您可以将数据帧连接在一起。 pandas.pydata.org/pandas-docs/stable/reference/api/… 因此,将训练数据连接在一起,并为测试数据帧做同样的事情。
-
您根本不必使用
train_test_split()。将您的三个火车文件加载为 x1、x2、x3。然后使用np.hstack()或np.vstack()或pd.concat()合并您的数据并将其命名为X_train。为 x_test 做类似的过程 -
实际上 train 和 test 文件之间的区别在于,在 test 文件中有一列是空的,所以我想知道 y_test 变量会受到什么影响。
标签: python dataframe machine-learning training-data test-data