【发布时间】:2017-03-20 16:17:31
【问题描述】:
我正在从事一个文本挖掘项目并尝试清理文本 - 单数/复数形式的单词、不同时态的动词和拼写错误的单词。我的示例如下所示:
test <- c("apple","apples","wife","wives","win","won","winning","winner","orange","oranges","orenge")
我尝试使用 SnowballC 包中的 wordStem 函数。然而结果是错误的:
"appl" "appl" "wife" "wive" "win" "won" "win" "winner" "orang" "orang" "oreng"
我想看到的是:
"apple" "apple" "wife" "wife" "win" "win" "win" "winner" "orange" "orange" "orange"
【问题讨论】:
-
您可能想查看 tm 包中的
stemCompletion函数。 -
您希望对结果做什么?对于文本分析的许多应用,两个不同形式的单词映射到同一个词干就足够了,而该词干不需要是实际的英语词根。特别是,您调用的函数使用了 Martin Porter 博士流行的词干算法的一个版本,它不会尝试找到实际的英语词根。结果并没有“错误”——它正在做它设计的事情,而不是你所期望的。
标签: r text-mining stemming