【发布时间】:2020-07-24 17:24:31
【问题描述】:
data.drop('Movie Title', axis=1, inplace=True)
features = data.loc[:, data.columns != 'worldwide_gross_usd']
charges = data['worldwide_gross_usd']
X_train, X_test, y_train, y_test = train_test_split(features,
charges,
random_state=42,
test_size = 0.2)
regr = LinearRegression().fit(X_train, y_train)
y_pred = regr.predict(X_test)
print('Trained R-squared score: ', regr.score(X_train, y_train))
print('Tested R-squared score: ', regr.score(X_test, y_test))
输出:
训练后的 R 平方分数:0.5404764241697003
测试的 R 平方分数:0.5845801856343114
X_train, X_test, y_train, y_test = train_test_split(features,
charges,
random_state=12,
test_size = 0.2)
regr = LinearRegression().fit(X_train, y_train)
y_pred = regr.predict(X_test)
print('Trained R-squared score: ', regr.score(X_train, y_train))
print('Tested R-squared score: ', regr.score(X_test, y_test))
输出:
训练后的 R 平方分数:0.5345435646372121
测试的 R 平方分数:0.602138324770633
您可以注意到,当我更改 random_state 值时,我的训练分数降低了 1%,但我的测试分数提高了 2%
第一个还是第二个,你更喜欢哪个 R 平方分数?
【问题讨论】:
-
请避免在整个段落中使用粗体。
标签: python machine-learning deep-learning linear-regression