【问题标题】:Weights of features in k-meansk-means 中的特征权重
【发布时间】:2017-12-30 09:50:09
【问题描述】:

我有一组要聚类的维基百科文本。

代码如下:

import pandas as pd                                             
import numpy as np                                             
from sklearn.feature_extraction.text import TfidfVectorizer
from sklearn.cluster import KMeans

#parameters
maximum_features = 1000000
max_intera = 300

#load text file
wiki = pd.read_csv('people_wiki.csv')

#TF-IDF vectorization
vectorizer = TfidfVectorizer(max_features=maximum_features, norm = 'l2', stop_words='english')
tfidf = vectorizer.fit_transform(wiki['text'])

#clustering
kmeans = KMeans(n_clusters=3, random_state=0, init='k-means++', max_iter = max_intera).fit(tfidf)

我想知道每个特征的权重,如下所示(她 0.025 她:0.017 .....):

总而言之:我想要每个特征(单词)的权重并呈现 5 个更相关的。

文件“people_wiki.csv”在这里:

https://ufile.io/udg1y

【问题讨论】:

    标签: python scikit-learn nlp k-means


    【解决方案1】:

    尝试使用此解决方案:

    print(tfidf.idf_)
    

    【讨论】:

      猜你喜欢
      • 2016-09-08
      • 2020-04-18
      • 2021-04-11
      • 2016-11-24
      • 2016-01-21
      • 1970-01-01
      • 2017-07-03
      • 2021-04-06
      • 1970-01-01
      相关资源
      最近更新 更多