【问题标题】:Get a result page from a research in google -> to PDF从谷歌研究中获取结果页面 -> 到 PDF
【发布时间】:2014-09-18 07:41:46
【问题描述】:

这是我正在尝试做的事情:通过 python 脚本,我想获取 Google 搜索结果的前 5 页并将它们保存为文件夹中的 PDF 文件。

你有什么建议?

(1) 我从一页一页解析 HTML 页面开始,然后找到一个工具将它们转换为 PDF 吗?

(2) 我找到了一种通过我还不知道的模组直接完成所有步骤的方法?

非常感谢您的见解!

【问题讨论】:

    标签: python parsing pdf


    【解决方案1】:

    使用标准 Python 库下载文件。然后您可以使用http://www.xhtml2pdf.com/ 将页面转换为PDF。

    注意:大多数网页使用大量的 JavaScript 来完成各种魔术。因此,对于许多页面,只有成熟的网络浏览器才能为您带来不错/有用的结果。如果你遇到这个问题,那么没有纯 Python 的解决方案。 Try phantomjs as explained here:

    phantomjs rasterize.js 'http://en.wikipedia.org/w/index.php?title=Jakarta&printable=yes' jakarta.pdf
    

    PS:我通过谷歌搜索python convert html to pdf找到了这些解决方案,您应该偶尔尝试一下。

    【讨论】:

    • 非常感谢您的回复。当然,在来这里之前我是用这种关键字搜索谷歌的。我不认为谷歌结果页面中有很多 Java,所以我会尝试使用 xhtml2pdf !
    • 您真的只想归档 Google 搜索结果的前 5 页(即不是第一个搜索结果后面的页面)?我认为 xhtml2pdf 可能就足够了。注意:Google 对使用机器人访问搜索结果有严格的规定。你应该阅读它们,否则你可能会被禁止:developers.google.com/web-search/terms
    猜你喜欢
    • 2015-09-09
    • 2023-03-20
    • 2012-02-17
    • 1970-01-01
    • 2018-12-19
    • 1970-01-01
    • 2017-09-13
    • 1970-01-01
    • 2016-07-17
    相关资源
    最近更新 更多