【发布时间】:2018-07-28 10:27:09
【问题描述】:
我有一个文本文件的语料库,只包含文本,我想从文本中提取 ngrams,并用他的原始文件名将每个文件保存在 3 列矩阵中..
library(tokenizer)
myTokenizer <- function(x, n, n_min) {
corp<-"this is a full text "
tok <- unlist(tokenize_ngrams(as.character(x), n = n, n_min = n_min))
M <- matrix(nrow=length(tok), ncol=3,
dimnames=list(NULL, c( "gram" , "num.words", "words")))
}
corp <- tm_map(corp,content_transformer(function (x) myTokenizer(x, n=3, n_min=1)))
writecorpus(corp)
【问题讨论】:
标签: data-extraction