【发布时间】:2018-01-30 00:33:42
【问题描述】:
我在我的部分文本数据上使用来自 sklearn 的 TfidfVectorizer() 来了解每个特征(单词)的词频。我当前的代码如下
from sklearn.feature_extraction.text import TfidfVectorizer
tfidf = TfidfVectorizer(analyzer='word', stop_words = 'english')
# fit_transform on training data
X_traintfidf = tfidf.fit_transform(X_train)
如果我想将'X_traintfidf'中每个术语的tf-idf值从最低到最高(反之亦然)排序,例如top10,并将这些排序的tf-idf值排名分成两个Series对象,如何我应该从代码的最后一行开始吗?
谢谢。
我正在阅读类似的thread,但不知道该怎么做。也许有人可以将该线程中显示的提示与我的问题联系起来。
【问题讨论】:
标签: python scikit-learn ranking tf-idf