【问题标题】:top terms in corpus gensimcorpus gensim 中的热门词
【发布时间】:2018-06-14 22:53:55
【问题描述】:

我使用 python 包 Gensim 进行聚类,我首先从给定文本的标记和词形还原句子创建了一个字典,然后使用这个字典使用以下代码创建了语料库:

 mydict = corpora.Dictionary(LemWords)
 corpus = [mydict.doc2bow(text) for text in LemWords]

我知道语料库将包含单词的 id 以及它们在每个文档中的频率。我想知道给定单词在整个语料库中出现的频率,以找到语料库中的热门词。我想知道是否有任何方法可以在整个语料库中返回术语的频率

【问题讨论】:

  • 你试过计算词频吗?

标签: python gensim counting corpus


【解决方案1】:

你可以试试这个:

import itertools
from collections import defaultdict

total_count = defaultdict(int)
for word_id, word_count in itertools.chain.from_iterable(corpus):
    total_count[word_id] += word_count

# Top ten words
sorted(total_count.items(), key=lambda x: x[1], reverse=True)[:10]

【讨论】:

    猜你喜欢
    • 2012-06-11
    • 1970-01-01
    • 2014-12-14
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-10-30
    • 2019-08-13
    相关资源
    最近更新 更多