【发布时间】:2016-06-07 12:45:29
【问题描述】:
我正在尝试将 NLTK 中使用的 dict 类型功能与每个实例的 SKLEARN tfidf 功能结合起来。
示例输入: instance=[["我正在处理文本数据"],["这是我的第二句话"]] instance = "我正在处理文本数据"
def generate_features(instance):
featureset["suffix"]=tokenize(instance)[-1]
featureset["tfidf"]=self.tfidf.transform(instance)
return features
from sklearn.linear_model import LogisticRegressionCV
from nltk.classify.scikitlearn import SklearnClasskifier
self.classifier = SklearnClassifier(LogisticRegressionCV())
self.classifier.train(feature_sets)
这个 tfidf 在所有实例上都经过训练。但是,当我使用此功能集训练 nltk 分类器时,它会引发以下错误。
self.classifier.train(feature_sets)
File "/Library/Python/2.7/site-packages/nltk/classify/scikitlearn.py", line 115, in train
X = self._vectorizer.fit_transform(X)
File "/Library/Python/2.7/site
packages/sklearn/feature_extraction/dict_vectorizer.py", line 226, in fit_transform
return self._transform(X, fitting=True)
File "/Library/Python/2.7/site-packages/sklearn/feature_extraction/dict_vectorizer.py", line 174, in _transform
values.append(dtype(v))
TypeError: float() argument must be a string or a number
我理解这里的问题,它无法对已经矢量化的特征进行矢量化。但是有没有办法解决这个问题?
【问题讨论】:
-
请提供样本数据以重现您的问题
标签: machine-learning nlp scikit-learn nltk feature-extraction