【发布时间】:2019-11-01 11:56:15
【问题描述】:
我有很多文件想在 R 中作为语料库阅读。所有的文件都是pdf,但最近,我意识到其中一些是txt。
在获得文本文件之前,我只是创建了目录中的 pdf 文件列表,并使用带有 readerControl 的 Corpus 函数读取它们:
getwd()
files <- list.files(pattern = "pdf$")
corp <- Corpus(URISource(files),
readerControl = list(reader = readPDF))
我尝试创建 pdf 和 txt 的组合列表,但我找不到将 readerContrl 用于 pdf 或 txt 的方法:
files1 <- list.files(pattern = "pdf$")
files2 <- list.files(pattern = "txt$")
files<-c(files1,files2)
corp <- Corpus(URISource(files),
readerControl = list(reader = c(readPDF,readPlain)))
关于如何解决这个问题的任何想法? 我考虑过合并两个 Copuses 元素,一个是 reader=readPDF,另一个是 reader=readPlain。但由于我是文本挖掘的新手,我不确定这样做的最佳实践是什么。
【问题讨论】: