【发布时间】:2021-08-30 19:59:06
【问题描述】:
我需要拆分数据以训练和测试控制组,所以我正在使用
sklearn.model_selection.GroupShuffleSplit
但是我不太了解参数n_splits。
我的代码如下所示:
gs = GroupShuffleSplit(n_splits=10, train_size=.7, random_state=42)
train_ix, val_ix = next(gs.split(X_new, y, groups=X_new.subjectid))
无论我为拆分选择什么数字,我都会拥有相同大小的数据集(正如我在 train_size 中指定的那样)。您能否解释一下 n_splits 的影响?
谢谢!
【问题讨论】:
标签: python scikit-learn