【发布时间】:2015-02-05 21:47:27
【问题描述】:
我有一个 NLP 任务(文本分类)。我提取了一些这样的二元组:
training_data = [[('this', 'is'), ('is', 'a'), ('a', 'text')],
[('and', 'one'), ('one', 'more')]]
然后我可以像这样使用一些矢量化器:
from sklearn.feature_extraction import FeatureHasher
fh = FeatureHasher(input_type='string')
X = fh.transform(((' '.join(x) for x in sample)
for sample in training_data))
print X.toarray()
[[ 0. 0. 0. ..., 0. 0. 0.]
[ 0. 0. 0. ..., 0. 0. 0.]]
这是可以使用 svm 算法进行分类的方式:
from sklearn import svm
s = svm.SVC()
lables = [HAM, SPAM]
s.fit(training_data, labels)
如何使用上述 brigam 中的标签(即training_data)进行分类?例如:
data = [[('this', 'is'), ('is', 'a'), ('a', 'text'), 'SPAM'],
[('and', 'one'), ('one', 'more'), 'HAM']]
【问题讨论】:
标签: python python-2.7 machine-learning nlp artificial-intelligence