【问题标题】:How to convert multi-page pdf to single html file如何将多页pdf转换为单个html文件
【发布时间】:2019-04-02 11:03:54
【问题描述】:

我正在实现 poppler pdftohtml 方法来将 pdf 转换为 html。我正在尝试通过 python 运行 exec 文件。

import subprocess

subprocess.Popen([r"D:/poppler-0.68.0/bin/pdftohtml.exe" , 'name.pdf', 'name.html'])

使用上面的代码,我得到了我的 html 文件以及 pdf 中每个页面的图像(.jpg)。

我只需要 html 文件而不是图像。我应该做出/添加哪些更改/参数才能获得预期的结果?

【问题讨论】:

    标签: python poppler


    【解决方案1】:

    根据their documentation,可能有两个选项可以帮助您:

    -i ignore images

    -s generate single HTML that includes all pages

    如果这些都行不通,你也无能为力。

    【讨论】:

    • 谢谢。有用。我得到一个带有灰色背景和黑色的html页面作为输出。我的 pdf 包含带有白色背景和黑色文本的页面。页面似乎也左对齐。你知道这是为什么吗?
    • @DGS 我认为这是因为pdftohtml 工具呈现它的方式。理论上,您可以在 python 中打开 HTML 并删除任何具有适用于 body 或其他主要容器的 background-color 的内联样式,当然假设所有 PDF 都有白色背景。
    • 我发现只有在参数中添加 -i 后,背景才会变成灰色。
    猜你喜欢
    • 2013-06-08
    • 2021-11-09
    • 2012-02-22
    • 2015-04-18
    • 2019-08-27
    • 2019-02-10
    • 1970-01-01
    • 1970-01-01
    • 2010-10-15
    相关资源
    最近更新 更多