【发布时间】:2021-12-20 02:43:01
【问题描述】:
所以我有以下数据集:
new_data=pd.read_csv('https://raw.githubusercontent.com/michalis0/DataMining_and_MachineLearning/master/data/regression_sales.csv')
然后我做了一个简单的线性回归:
y = np.array(new_data['sales_per_day'])
X = np.array(new_data[['number_orders', 'number_items', 'number_segments', 'year', 'month', 'day']])
X.shape, y.shape
train, test = train_test_split(df, test_size=0.2, train_size=0.8, random_state = 77)
from sklearn.linear_model import LinearRegression
regression_model = LinearRegression(fit_intercept=True)
regression_model.fit(X, y)
我现在想标准化'number_orders', 'number_items', 'number_segments',这是我尝试过的:
from sklearn.preprocessing import StandardScaler
Std_Scaler = StandardScaler()
Std_data = Std_Scaler.fit_transform(X_train)
Std_data = pd.DataFrame(Std_Scaler.transform(X_test), columns=['number_items', 'number_orders', 'number_segments'])
但是我收到以下错误ValueError: Wrong number of items passed 6, placement implies 3。
问题是我只想标准化这三列和其他三列(year, month, day),但我似乎无法使其工作。
你知道有什么方法可以只标准化数据集的一部分吗?
【问题讨论】:
标签: python pandas scikit-learn regression data-mining