【发布时间】:2021-04-02 17:04:06
【问题描述】:
我有 3 列 Smiles、Column 和流动相。
我想将我的数据集转换为语料库作为训练数据集并应用 Gensim 模型。
这是我的数据集链接
https://drive.google.com/file/d/1S80I_5zkjJfeTzby7OjIqrs1vMJI6jVo/view?usp=sharing
我已经提到了这个 StackOverflow 问题,但无法解决
How to create corpus from pandas data frame to operate with NLTK
【问题讨论】:
-
您要应用哪个 gensim 模型?为什么需要创建语料库?
-
我想试试这个模型 doc_to_vec 作为我的实验tutorialspoint.com/gensim/gensim_doc2vec_model.htm
-
@AlokNayak 对我们要应用 gensim 模型的此类数据集的任何建议。
-
在 gensim 的 TaggedDocument 和以后的培训 doc2vec 中使用之前,您需要使用空格或任何正则表达式将文本拆分为单词列表
标签: python pandas dataframe gensim corpus