【发布时间】:2020-03-11 05:19:59
【问题描述】:
我有一个 .csv 术语文档矩阵,我想在 python 中使用 gensim 执行一些潜在的狄利克雷分配。但是,我对 Python 或 LDA 并不是特别熟悉。
我在 gensim...论坛发帖?不知道是不是这么叫的。写包裹的人回应说:
您的术语文档 CSV 矩阵有多大?
如果它足够小 = 适合 RAM,您可以:
1) 使用 numpy.loadtxt() 将您的 CSV 加载到内存矩阵中
2) 使用 gensim.matutils.Dense2Corpus() 将矩阵转换为语料库。查看它的documents_columns 标志,它可以让您轻松地在document-term 和term-document 转置之间切换。
3) 使用该语料库来训练您的 LDA 模型。
这让我相信this question 的答案不正确。
似乎字典是 LDA 模型的必要输入;这不正确吗?这就是我认为成功地将 .csv 粘贴到语料库中的内容。
file = np.genfromtxt(fname=fPathName, dtype="int", delimiter=",", skip_header=True, missing_values="", filling_values=0)
corpus = gensim.matutils.Dense2Corpus(file, documents_columns=False)
任何帮助将不胜感激。
编辑:事实证明 Gensim 字典和 Python 字典并不完全相同。
【问题讨论】: