【发布时间】:2012-08-28 01:46:52
【问题描述】:
我正在参加 this Kaggle competition,我想知道是否有人熟悉 R 中 LSA package 中的 textmatrix 函数。 p>
基本上,textmatrix 函数接受一个目录作为参数,它会使用在指定目录中找到的所有文本文件创建一个文本矩阵。
不幸的是,textmatrix 函数在遇到包含零项的文本文件时会抛出错误(例如,如果您使用停用词进行过滤,就会发生这种情况)。
有谁知道一种简单的方法来让 textmatrix ignore 文件以零项结尾?或者有一种相对快速的方法来识别和删除这些文件?
TIA!
【问题讨论】: