【发布时间】:2015-02-24 14:59:15
【问题描述】:
我是新手。我写了一个scraper,它将刮掉Maplin 商店。我使用 Python 作为语言并使用 BeautifulSoup 来抓取商店。
我想问一下,如果我需要爬取其他电子商务商店(例如 Amazon、Flipkart),我是否需要自定义我的代码,因为它们具有不同的 HTML 架构(id 和 class 名称不同,另外其他事情也是如此)。所以,我写的刮板不适用于其他电子商务商店。
我想知道比价网站如何从所有在线商店中抓取数据?他们对不同的在线商店有不同的代码还是有一个通用的代码?他们是否研究过每个在线商店的 HTML 架构?
【问题讨论】:
-
他们研究每个网页的 HTML 架构
-
@sputnick- 那么不同的在线商店有不同的代码吗?
-
他们通常会使用某种路径规范(xpath 或 CSS 选择器)编写一个相当容易为不同商店定制的刮板,以查找感兴趣的数据。可能需要一些最少的代码。
-
好吧,在这种情况下,我猜这样的代码很容易在网页更改时变得无效,即使是轻微的更改。我应该如何编写不易受这些变化影响的爬虫?
-
要求第三方网站公开 REST API
标签: python html web-scraping beautifulsoup html-parsing