【发布时间】:2022-08-20 01:13:07
【问题描述】:
from sklearn.preprocessing import StandardScaler
sc = StandardScaler()
X_train = sc.fit_transform(X_train)
X_test = sc.transform(X_test)
我所知道的是fit() 方法计算特征的均值和标准差,然后transform() 方法使用它们将特征转换为新的缩放特征。 fit_transform() 只不过是在一行中调用 fit() 和 transform() 方法。
但是这里为什么我们只为训练数据而不是测试数据调用fit()?
这是否意味着我们正在使用训练数据的均值和标准差来转换我们的测试数据??
-
这是因为你想避免data leakage。
标签: python machine-learning scikit-learn data-science data-analysis