【发布时间】:2015-02-13 12:42:14
【问题描述】:
我想解析使用 scrapy 抓取网站时遇到的 PDF 文档。我正在使用以下代码从 PDF 文档中提取 HTML 页面源代码,但它不起作用
a = response.xpath("//html").extract()
如何从 PDF 文档中获取内容并将其合并到 scrapy 工作流程中?
【问题讨论】:
-
不是很清楚。你能展示你到目前为止所做的代码吗?所以你正在使用scrapy将pdf作为html阅读??
-
PDF 链接?你的意思是当你在浏览器中打开一个PDF文件时?那根本不是 HTML 页面,那是您的浏览器呈现 PDF 文件并向您显示其内容,您不能废弃它的数据。您可以使用pypi.python.org/pypi/pdfquery 等 Python 库从 PDF 文件中提取数据。
标签: python python-2.7 pdf web-scraping scrapy