【问题标题】:Decode weird characters by pdf.js通过 pdf.js 解码奇怪的字符
【发布时间】:2016-05-10 12:09:04
【问题描述】:

我正在使用 pdf.js 将 pdf 转换为文本。我注意到显示了一些奇怪的字符,但仅在 HTML 中。

当它们被渲染时,会出现正确的内容(人类可读的文本)。

但是,如果我使用 innerHTML 来获取内容,我会得到一些奇怪的东西。

生成这个HTML的部分代码取自here,是:

this.pdfToText = function(data) {
   var div = document.getElementById('viewer');

   // render the first pages
   var pdf = new PDFJS.PDFDoc(data);
   var total = pdf.numPages;

   for (i = 1; i <= total; i++) {
       var page = pdf.getPage(i);

       var canvas = document.createElement('canvas');
       document.body.appendChild(canvas);
       canvas.id = 'page' + i;
       canvas.mozOpaque = true;
       div.appendChild(canvas);

       canvas.width = page.width;
       canvas.height = page.height;

       var context = canvas.getContext('2d');
       context.save();
       context.fillStyle = 'rgb(255, 255, 255)';
       context.fillRect(0, 0, canvas.width, canvas.height);
       context.restore();

       self.setMessage("Rendering...");

       var textLayer = document.createElement('div');
       textLayer.className = 'textLayer';
       document.body.appendChild(textLayer);

       page.startRendering(context, function() {
           if (++self.complete == total) {
               self.setMessage("Finished rendering. Extracting text...");

               window.setTimeout(function() {
                   var layers = [];
                   var nodes = document.querySelectorAll(".textLayer > div");
                   for (var j = 0; j < nodes.length; j++) {
                       layers.push(nodes[j].textContent + "\n");
                   }
                   self.sendOutput(layers.join("\n"));

                   self.setMessage("Done!");
               }, 1000);
           }
       }, textLayer);
   }
};

如何将这些字符解码为人类可读的文本并将值存储到变量中?

【问题讨论】:

  • 大概 pdf.js 无法确定正确的编码(因为它不能做这样的事情,或者它可以但编码不在 PDF 开头)并创建了一个 ad hoc编码和随附的字体文件。 “解码成人类可读的文本”只能手动完成,每个字体(子集),记下用什么字符替换什么代码。
  • 您用作基础的代码太旧了。请使用现代图书馆并在github.com/mozilla/pdf.js/tree/master/examples/text-only 上查看更好的示例。很难判断出问题的 PDF 或库是否请提供尽可能多的详细信息,否则您的问题有太多类似上述的答案或“不要使用 XXX”
  • @async5 我用了那个例子,效果很好。你能发布一个答案,这样你就会得到一些分数吗? :)

标签: javascript pdf pdf.js


【解决方案1】:

上面示例中使用的 PDF.js 版本是旧版本 - 新版本添加了文本提取 API,例如获取文本上下文()。请在http://github.com/mozilla/pdf.js/tree/master/examples/text-only查看更好的示例

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2016-12-01
    • 1970-01-01
    • 2018-02-02
    • 2015-04-03
    相关资源
    最近更新 更多