【发布时间】:2018-06-14 22:53:55
【问题描述】:
我使用 python 包 Gensim 进行聚类,我首先从给定文本的标记和词形还原句子创建了一个字典,然后使用这个字典使用以下代码创建了语料库:
mydict = corpora.Dictionary(LemWords)
corpus = [mydict.doc2bow(text) for text in LemWords]
我知道语料库将包含单词的 id 以及它们在每个文档中的频率。我想知道给定单词在整个语料库中出现的频率,以找到语料库中的热门词。我想知道是否有任何方法可以在整个语料库中返回术语的频率
【问题讨论】:
-
你试过计算词频吗?
标签: python gensim counting corpus