【发布时间】:2019-05-14 11:56:21
【问题描述】:
我正在尝试使用包含两列(摘要和解决方案)的数据集的词袋问题。我正在使用 KNN。训练数据集有 91 列,测试数据集有 15 列。
为了生成向量,我使用了以下代码。
vectorizer = CountVectorizer()
train_bow_set = vectorizer.fit_transform(dataset[0]).todense()
print( vectorizer.fit_transform(dataset[0]).todense() )
print( vectorizer.vocabulary_ )
我训练过它。
classifier = KNeighborsClassifier(n_neighbors=3)
classifier.fit(train_bow_set, dataset[1])
现在,我正在测试它。
y_pred = classifier.predict(test_bow_set)
在这里,我在测试时遇到以下错误:
sklearn/neighbors/binary_tree.pxi in sklearn.neighbors.kd_tree.BinaryTree.query()
**ValueError: query data dimension must match training data dimension**
【问题讨论】:
-
你是如何创建 test_bow_set 的?
标签: python machine-learning scikit-learn knn