【发布时间】:2018-04-04 08:30:57
【问题描述】:
我目前在查找与使用文本挖掘在 R 中创建句子术语矩阵相关的任何内容时遇到了麻烦。
我正在使用 tm 包,我唯一能找到的就是转换为 tdm 或 dtm。
我只使用一个 Excel 文件,我只对其中一列的文本挖掘感兴趣。那一列中有大约 1200 行。我想创建一个行(句子) - 术语矩阵。我想创建一个矩阵,告诉我每行(句子)中单词的频率。
我想创建一个包含 1 和 0 的矩阵,以便稍后运行 PCA 分析。
在我的情况下,dtm 没有帮助,因为我只使用一个文件,行数为 1,列是整个文档中单词的频率。
相反,如果有意义的话,我想将这些句子视为文档。从那里,我想要一个矩阵,其中包含每个句子中单词的频率。
谢谢!
【问题讨论】:
标签: r text-mining