【发布时间】:2018-07-03 07:11:55
【问题描述】:
我正在使用 Scikit-learn 进行文本分类。我使用朴素贝叶斯分类将非结构化文本(下面数据集中的详细信息列)分类为一组标记的目标(类别),我得到了测试数据的准确性,但是有人可以告诉我如何打印,到哪个每个非结构化文本(来自下面数据集中的详细信息列)属于哪个类别?
这是我的示例数据集的样子。
Details |Category
-------------------------------------------------------------
Tanishq Jwellery Bangalore |jwellery
ODESK***BAL-28APR13 |Others
AEGON RELIGARE LIFE IN |Others
INTERNET PAYMENT #999999 |Transfer in for Card Payment
WWW.VISTAPRINT.IN |Others
Khazana Jwellery |jwellery
INTERNET PAYMENT #999999 |Transfer in for Card Payment
Indian Oil |Fuel
Touch foot wear |Clothing
这是我的代码的一部分:
import pandas as pd
import numpy as np
import scipy as sp
from sklearn.model_selection import train_test_split
u_cols = ['Details','Category']
k= pd.read_csv('mydatset.csv', delimiter='\t',usecols = u_cols)
data=k[1:1000]
target_one=data['Category']
from sklearn.cross_validation import train_test_split
def train(classifier, X, y):
X_train, X_test, y_train, y_test =
train_test_split(data.Details.values.astype('U'), target_one,
test_size=0.50, random_state=33)
classifier.fit(X_train, y_train)
print ("Accuracy: %s" % classifier.score(X_test, y_test))
return classifier
from sklearn.naive_bayes import MultinomialNB
from sklearn.pipeline import Pipeline
from sklearn.feature_extraction.text import TfidfVectorizer
trial1 = Pipeline([('vectorizer', TfidfVectorizer()),
('classifier', MultinomialNB())])
train(trial1, data.Details.values.astype('U'), target_one)
【问题讨论】:
-
请不要将数据样本更改为图像。那我们怎么复制呢?
-
好的,对不起先生,这是我的第一个问题。
标签: python scikit-learn