【发布时间】:2018-05-25 11:55:02
【问题描述】:
我有一个包含两列的简单 CSV:
- ErrorWeek(一年中的周数)
- ErrorCount(给定一周内的错误数)
我将 CSV 数据读入 pandas 数据框,如下所示:
df = pd.read_csv("Errors.csv", sep=",")
df.head() 显示:
ErrorWeek ErrorCount
0 1 80
1 2 118
2 3 249
3 4 397
4 5 159
到目前为止一切顺利。
然后,我创建一个测试/训练拆分,如下所示:
X_train, X_test, y_train, y_test = train_test_split(
df['ErrorWeek'], df['ErrorCount'], random_state=0)
目前没有错误。
但是,我随后创建了一个线性回归对象并尝试拟合数据。
# Create linear regression object
regr = linear_model.LinearRegression()
# Train the model using the training sets
regr.fit(X_train, y_train)
这里我确实收到错误:“使用 array.reshape(-1, 1) 重塑您的数据”
--
查看 X_Test 和 y_Test 的形状,我得到了看起来像两个一维“数组”的东西:
X_train shape: (36,)
y_train shape: (36,)
--
我花了很多时间试图弄清楚这一点,但我是 Pandas、Python 和 scikit-learn 的新手。
我正在读取二维数据,但 Pandas 不这么看。
具体来说,我需要做什么?
谢谢,
【问题讨论】:
标签: pandas scikit-learn