【发布时间】:2015-12-03 09:14:30
【问题描述】:
在这个question 中,我询问了如何拆分一个巨大的数据框来创建一个语料库。感谢答案,我能够从数据框创建一个列表。 我的问题仍然是从我创建的列表中获取语料库,以便进行一些文本挖掘并根据搜索词对数据进行聚类。
【问题讨论】:
在这个question 中,我询问了如何拆分一个巨大的数据框来创建一个语料库。感谢答案,我能够从数据框创建一个列表。 我的问题仍然是从我创建的列表中获取语料库,以便进行一些文本挖掘并根据搜索词对数据进行聚类。
【问题讨论】:
为了解决这个问题,我只是将 tm 包的 as.VCorpus 函数应用到了我之前创建的列表中:
new_corpus <- as.VCorpus(new_list)
检查新对象是否为语料库:
class(new_corpus)
[1] "VCorpus" "Corpus"
因此,我创建了一个“易失性语料库”。正如 R 文档中所写:
易失性语料库完全保存在内存中,因此所有更改仅影响相应的 R 对象。
【讨论】: