【发布时间】:2015-04-07 09:49:03
【问题描述】:
我正在尝试编写一个爬虫来获取原始 html 数据并查找标题、价格、更新日期、照片等字段并将其写入数据库。这是一种经典且古老的数据抓取方式。
我认为我可以通过其他方式完成这项工作。
如果我抓取网站中的所有页面(可能超过 1000 个),并比较它们,我可以找到特定区域。
我的意思是html标签总是一样的。只有特定区域会更改,例如标题、图像等...
那么,确定变化区域的最佳方法是什么?
【问题讨论】:
-
我觉得,xml diff 不是正确的答案,因为它比较了两个 xml 文件。但我需要一个解决方案来比较 1000 页。
标签: html web-scraping web-crawler