【问题标题】:Handling pdf documents when crawling using scrapy使用scrapy抓取时处理pdf文档
【发布时间】:2015-02-13 12:42:14
【问题描述】:

我想解析使用 scrapy 抓取网站时遇到的 PDF 文档。我正在使用以下代码从 PDF 文档中提取 HTML 页面源代码,但它不起作用

a = response.xpath("//html").extract()

如何从 PDF 文档中获取内容并将其合并到 scrapy 工作流程中?

【问题讨论】:

  • 不是很清楚。你能展示你到目前为止所做的代码吗?所以你正在使用scrapy将pdf作为html阅读??
  • PDF 链接?你的意思是当你在浏览器中打开一个PDF文件时?那根本不是 HTML 页面,那是您的浏览器呈现 PDF 文件并向您显示其内容,您不能废弃它的数据。您可以使用pypi.python.org/pypi/pdfquery 等 Python 库从 PDF 文件中提取数据。

标签: python python-2.7 pdf web-scraping scrapy


【解决方案1】:

Scrapy 可能不是解析 pdf 文档的最佳工具。但是您可以在抓取时识别此类链接并添加处理此类文档的功能。一个解决方案是有一个解析函数来处理这种情况并在遇到pdf页面时调用它。

正如@Morad Edwar 所指出的,您可以使用像
pdfquery 这样的库 PDFMiner等

您可以使用这些库提取数据并将该数据放入项目管道中,就像您通常使用 scrapy 所做的那样。

【讨论】:

  • 我可以使用 pdfquery 和 PDFMiner 提取文本数据,但是如何将该 PDF 页面提取为 HTML 源代码。
  • 将 pdf 提取为 HTML?你想使用 xpaths 来提取数据吗?
  • 是的,我想将 PDF 提取为 HTML。如果完成,我可以使用 xpath 来提取数据
  • 在pdfquery和PDFMiner中,可以使用xpaths。
猜你喜欢
  • 1970-01-01
  • 2015-09-26
  • 1970-01-01
  • 1970-01-01
  • 2018-10-12
  • 2020-02-01
  • 2017-09-18
  • 1970-01-01
  • 2011-03-28
相关资源
最近更新 更多