【问题标题】:R not reading text in from PDFR没有从PDF中读取文本
【发布时间】:2020-05-05 15:29:17
【问题描述】:

一段时间以来,我一直在尝试将 PDF 文件夹读入 R 以制作语料库。我用过:

teleeos<- readtext("C:/Users/dklimkina/Desktop/Text Analysis Project/Corpus/Telehealth", encoding = "UTF-8")
directory<-("C:/Users/dklimkina/Desktop/Text Analysis Project/Corpus/Telehealth")
teleeos<- readtext(directory) 

和

setwd("C:/Users/dklimkina/Desktop/Text Analysis Project/Corpus/Telehealth")
install.packages("pdftools")
library(pdftools)
files <- list.files(pattern = "pdf$")

我已经更改了我的 PDF 类型,但无论我做什么,我一直得到的只是PDF error (63): Illegal character &lt;29&gt; in hex string。有什么想法吗?

【问题讨论】:

    标签: r hex corpus quanteda


    【解决方案1】:

    尝试隔离导致问题的文件并进一步检查它是值得的。如果没有可重现的示例或无法访问原始文件,我们将无法进一步帮助您。

    首先,尝试不使用 encoding = "UTF-8" 参数。

    您也可以尝试其他工具。由于我看到您使用的是 Windows,请尝试以下操作:

    1. 为您的平台下载xpdf 工具套件。这包括您需要的部分,pdftotext。

    2. 在程序/附件中按如下方式使用 Windows PowerShell ISE(集成脚本环境)(根据您的系统需要调整路径)来运行此脚本。

    它可能会更好地将您的文件转换为文本。

    cd "C:/Users/dklimkina/Desktop/Text Analysis Project/Corpus/Telehealth"
    $FILES = ls *.pdf
    foreach ($f in $FILES) {
        pdftotext -enc UTF-8 $f
    }
    

    如果该脚本失败,那么如果您成功隔离了问题 pdf,请尝试在该文件上运行 pdftotext problemfile.pdf 并查看是否有效。

    【讨论】:

      猜你喜欢
      • 2023-03-25
      • 2019-11-01
      • 1970-01-01
      • 2013-12-29
      • 1970-01-01
      • 1970-01-01
      • 2017-05-08
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多