【问题标题】:Splitting of training and validation dataset训练和验证数据集的拆分
【发布时间】:2021-02-17 14:02:26
【问题描述】:

我需要将我的训练数据 (80-20) 拆分为验证数据,使拆分的子数据集不是随机的,而是始终相同。

目前我使用此代码

from sklearn.model_selection import train_test_split
X_train, X_val, Y_train, Y_val = train_test_split(X, Y, test_size=0.2)

但拆分的子数据集始终是随机的,并且永远不会相同。我希望它是随机的,但是当我再次运行代码时应该存在相同的值(类似于 np.random.seed)

有没有办法做到这一点?

【问题讨论】:

    标签: python dataset


    【解决方案1】:

    train_test_split() 有一个 random_state 参数。如果您为其分配一个整数值,则结果将始终相同:

    from sklearn.model_selection import train_test_split
    X_train, X_val, Y_train, Y_val = train_test_split(X, Y, test_size=0.2, random_state=1)
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-05-01
      • 2019-04-22
      • 2016-09-13
      • 2020-02-10
      • 2020-10-01
      • 2021-09-17
      • 2020-02-29
      • 2021-01-19
      相关资源
      最近更新 更多