【发布时间】:2015-08-31 04:13:20
【问题描述】:
我正在使用 Numpy 加载 csv 作为数据集,以在 Python 中创建决策树模型。使用下面的提取将第 0-7 列放在 X 中,最后一列作为 Y 中的目标。
#load and set data
data = np.loadtxt("data/tmp.csv", delimiter=",")
X = data[:,0:7] #identify columns as data sets
Y = data[:,8] #identfy last column as target
#create model
clf = tree.DecisionTreeClassifier()
clf = clf.fit(X, Y)
我想知道的是是否可以在任何列中使用分类器。例如,如果它在第四列中,以下代码是否仍能正确拟合模型,或者在预测时会产生错误?
#load and set data
data = np.loadtxt("data/tmp.csv", delimiter=",")
X = data[:,0:8] #identify columns as data sets
Y = data[:,3] #identfy fourth column as target
#create model
clf = tree.DecisionTreeClassifier()
clf = clf.fit(X, Y)
【问题讨论】:
-
我不这么认为。它会知道输出总是等于第四个特征:D
-
X = data[:,0:8]和Y = data[:,3]表示您将在特征中包含目标!
标签: python csv numpy scikit-learn classification