【发布时间】:2021-01-11 09:20:35
【问题描述】:
我想对一个德语单词列表进行词形还原,包括名词和动词。这里的难题在于,这意味着单词以大写字母开头,而其他单词则以小写字母开头。到目前为止,我一直在使用查找列表。这里是样本
lookup_list <-
data.frame(
cbind(
c("mache","tust","Tuns","Reisen","genaue","genauer","pflanze","Pflanzen","reise"),
c("machen","tuen","Tun","Reise","genau","genau","pflanzen","Pflanze","reisen")
)
)
names(lookup_list) <- c("word","lemma")
Text2Lemmatize <- "mache tust Tuns Reisen genaue genauer pflanze Pflanzen reise"
问题是 '''lemmatize()''' 会忽略列表中以大写字母开头的单词。
lemmatize_strings(Text2Lemmatize, lookup_list)
> lemmatize_strings(Text2Lemmatize, lookup_list)
[1] "machen tuen Tuns Reisen genau genau pflanzen Pflanzen reisen"
谁能帮我解决这个小问题?
提前致谢!
【问题讨论】:
标签: r text-mining capitalization lemmatization tolower