【发布时间】:2017-04-21 13:02:39
【问题描述】:
我正在考虑抓取数千个页面并需要一个解决方案。每个站点都有自己的 html 代码 - 它们都是独特的站点。没有可用的干净数据馈送或 API。我希望将捕获的数据加载到某种数据库中。
如果可能的话,有什么想法可以用 scrapy 做到这一点吗?
【问题讨论】:
-
您说“没有可用的干净数据馈送或 API”,仍然想在某处“加载捕获的 数据”。你实际上在寻找什么?如果它似乎不可用,你将如何获得它?..
-
为什么要专门用scrapy?
-
@JulienNioche,您知道用于此类操作的更好工具吗?
-
@sympi 联系世界上的每个网站所有者,请他们为您构建标准 API。完成后告诉我,我会为你编写 Scrapy 代码。
标签: python scrapy web-crawler