【发布时间】:2014-09-18 07:41:46
【问题描述】:
这是我正在尝试做的事情:通过 python 脚本,我想获取 Google 搜索结果的前 5 页并将它们保存为文件夹中的 PDF 文件。
你有什么建议?
(1) 我从一页一页解析 HTML 页面开始,然后找到一个工具将它们转换为 PDF 吗?
(2) 我找到了一种通过我还不知道的模组直接完成所有步骤的方法?
非常感谢您的见解!
【问题讨论】:
这是我正在尝试做的事情:通过 python 脚本,我想获取 Google 搜索结果的前 5 页并将它们保存为文件夹中的 PDF 文件。
你有什么建议?
(1) 我从一页一页解析 HTML 页面开始,然后找到一个工具将它们转换为 PDF 吗?
(2) 我找到了一种通过我还不知道的模组直接完成所有步骤的方法?
非常感谢您的见解!
【问题讨论】:
使用标准 Python 库下载文件。然后您可以使用http://www.xhtml2pdf.com/ 将页面转换为PDF。
注意:大多数网页使用大量的 JavaScript 来完成各种魔术。因此,对于许多页面,只有成熟的网络浏览器才能为您带来不错/有用的结果。如果你遇到这个问题,那么没有纯 Python 的解决方案。 Try phantomjs as explained here:
phantomjs rasterize.js 'http://en.wikipedia.org/w/index.php?title=Jakarta&printable=yes' jakarta.pdf
PS:我通过谷歌搜索python convert html to pdf找到了这些解决方案,您应该偶尔尝试一下。
【讨论】: