【问题标题】:How to avoid error in textmatrix function in R's LSA package如何避免 R 的 LSA 包中的 textmatrix 函数出错
【发布时间】:2012-08-28 01:46:52
【问题描述】:

我正在参加 this Kaggle competition,我想知道是否有人熟悉 R 中 LSA package 中的 textmatrix 函数。 p>

基本上,textmatrix 函数接受一个目录作为参数,它会使用在指定目录中找到的所有文本文件创建一个文本矩阵。

不幸的是,textmatrix 函数在遇到包含零项的文本文件时会抛出错误(例如,如果您使用停用词进行过滤,就会发生这种情况)。

有谁知道一种简单的方法来让 textmatrix ignore 文件以零项结尾?或者有一种相对快速的方法来识别和删除这些文件?

TIA!

【问题讨论】:

    标签: r kaggle lsa


    【解决方案1】:

    我不知道如何让它忽略空文件。我使用的一种解决方法是将语料库中尚未出现的单词添加到每个文件中。

    优点:

    • 每个文件都至少有一个单词,这样textmatrix 就不会失败
    • 每个文件中的同一个词不会影响单个文档的相关性
    • 你知道根据textmatrix的单词数比原始文档中的单词数多1

    缺点:

    • 每个文件都变得有点相似,因为它们都共享一个词。

    (注意:可能有我没有想到的缺点。)

    【讨论】:

      猜你喜欢
      • 2017-09-08
      • 2016-03-27
      • 2015-02-26
      • 1970-01-01
      • 2020-08-19
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多