【发布时间】:2019-11-15 19:03:56
【问题描述】:
我想根据 Jstor 提供的数据创建一个主题模型(例如https://www.jstor.org/dfr/about/sample-datasets)。但是,由于版权原因,它们不允许全文访问。相反,我可以请求一个一元词列表,然后是它们在文档中的频率(以纯 .txt 提供)。例如:
his 295
old 181
he 165
age 152
p 110
from 79
life 74
de 71
petrarch 58
book 51
courtier 47
这应该很容易转换为词袋向量。但是,我只找到了从全文构建的 Gensim LDA 模型的示例。是否可以将这些向量传递给它?
【问题讨论】:
标签: vector lda topic-modeling jstor