【发布时间】:2016-02-09 21:56:00
【问题描述】:
我之前使用 cross_validation.train_test_split 将我的数据集拆分为 90:10 的比例。我现在转到了 Stratified Shuffle Split(在 scikit-learn 中合并了 Kfold 和 Shuffle Split)。我想了解使用指定的测试大小进行分层划分是否更好,还是我应该不指定测试大小就这样做?
这就是我正在做的:
train=[]
with open("/Users/minks/Documents/documents.txt") as f:
for line in f:
train.append(line.strip().split())
train=np.array(train)
labels=[]
with open("/Users/minks/Documents/Labels.txt") as t:
for line in t:
labels.extend(line.strip().split())
labels=np.array(labels)
kf=StratifiedShuffleSplit(labels, n_iter=5, test_size=0.10)
for train_index, test_index in kf:
X_train, X_test = train[train_index],train[test_index]
Y_train, Y_test = labels[train_index],labels[test_index]
我想知道指定 test_size 是否是一个好的性能决定,因为如果我不这样做,它会获取随机比率。
【问题讨论】:
标签: python scikit-learn