【问题标题】:Creating LDA model using gensim from bag-of-words vectors使用 gensim 从词袋向量创建 LDA 模型
【发布时间】:2019-11-15 19:03:56
【问题描述】:

我想根据 Jstor 提供的数据创建一个主题模型(例如https://www.jstor.org/dfr/about/sample-datasets)。但是,由于版权原因,它们不允许全文访问。相反,我可以请求一个一元词列表,然后是它们在文档中的频率(以纯 .txt 提供)。例如:

his         295
old         181
he          165
age         152
p           110
from         79
life         74
de           71
petrarch     58
book         51
courtier     47

这应该很容易转换为词袋向量。但是,我只找到了从全文构建的 Gensim LDA 模型的示例。是否可以将这些向量传递给它?

【问题讨论】:

    标签: vector lda topic-modeling jstor


    【解决方案1】:

    是的,您只需要将(word, frequency) 转换为(word_number, frequency),并将元组列表传递给任何gensim 模型的corpus。要将单词转换为数字,可以先统计整个语料库中有多少个单词,假设我们有V个单词,那么每个单词可以表示为1到V之间的整数.

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-12-01
      • 1970-01-01
      • 1970-01-01
      • 2018-11-27
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多