【发布时间】:2020-12-13 17:21:13
【问题描述】:
所以我有一个包含 120 行和 124 列的数据集。依赖列是人员的字符串名称。一共有20个不同的名字。我想从每个类中提取两行(因此为每个类提取具有相同名称的两行),以便我可以使用它创建一个测试集。任何帮助将不胜感激。谢谢
【问题讨论】:
-
创建测试数据的最佳实践是使用函数 train_test_split()
标签: python pandas dataframe dataset
所以我有一个包含 120 行和 124 列的数据集。依赖列是人员的字符串名称。一共有20个不同的名字。我想从每个类中提取两行(因此为每个类提取具有相同名称的两行),以便我可以使用它创建一个测试集。任何帮助将不胜感激。谢谢
【问题讨论】:
标签: python pandas dataframe dataset
您可以使用以下函数来做到这一点:
X_train,X_test,y_train,y_test = train_test_split(X,y,test_size=0.2,stratify =y)
这里,
X = 包含所有自变量的数据框。
y = 具有因变量的系列。
test_size = 您希望作为测试大小的百分比,此处为 20%。
分层 = 所有类别的平均分配,在你的例子中是 20 人。
【讨论】: