【问题标题】:Is there any way to convert python pandas dataframe to NLP corpus or documentation?有没有办法将 python pandas 数据帧转换为 NLP 语料库或文档?
【发布时间】:2021-04-02 17:04:06
【问题描述】:

我有 3 列 Smiles、Column 和流动相。

我想将我的数据集转换为语料库作为训练数据集并应用 Gensim 模型。

这是我的数据集链接

https://drive.google.com/file/d/1S80I_5zkjJfeTzby7OjIqrs1vMJI6jVo/view?usp=sharing

我已经提到了这个 StackOverflow 问题,但无法解决

How to create corpus from pandas data frame to operate with NLTK

【问题讨论】:

  • 您要应用哪个 gensim 模型?为什么需要创建语料库?
  • 我想试试这个模型 doc_to_vec 作为我的实验tutorialspoint.com/gensim/gensim_doc2vec_model.htm
  • @AlokNayak 对我们要应用 gensim 模型的此类数据集的任何建议。
  • 在 gensim 的 TaggedDocument 和以后的培训 doc2vec 中使用之前,您需要使用空格或任何正则表达式将文本拆分为单词列表

标签: python pandas dataframe gensim corpus


【解决方案1】:

任何单词列表都可以转换为 TaggedDocument 列表并用于训练 doc2vec 模型。或者,您可以先将数据框的文本列拆分为单词列表,然后遍历输出 pandas 系列以创建 TaggedDocument 列表。这是您的数据集的示例用法。假设您将 pandas 数据帧加载为 df,然后

output_ser = df.loc[:, 'Mobile Phase'].str.split(r'[/\s\\]+')
documents = [TaggedDocument(doc, [i]) for i, doc in enumerate(output_ser)]
model = Doc2Vec(documents, vector_size=5, window=2, min_count=1, workers=1)

点击此链接https://radimrehurek.com/gensim/models/doc2vec.html查看用法示例

【讨论】:

  • 感谢您的帮助和支持,它正在处理一列,但尝试使用整个数据集,它不会在语料库中转换
  • doc2vec 模型中只能使用文本,如果要使用 pandas 数据框的所有列,则可能需要将所有列连接到一个文本/字符串列中。
  • 谢谢,@Alok Nayak 我一直在努力。很快就会更新。
猜你喜欢
  • 2020-04-09
  • 1970-01-01
  • 2018-05-24
  • 2019-04-14
  • 2021-05-15
  • 2021-07-27
  • 2018-04-08
  • 2012-05-10
  • 1970-01-01
相关资源
最近更新 更多