【发布时间】:2020-12-14 15:50:01
【问题描述】:
我制作了一个可以抓取亚马逊的 Scrapy 网络爬虫。它可以通过使用关键字列表搜索项目并从结果页面中抓取数据来进行抓取。
但是,我想从亚马逊获取大部分产品数据。我没有用于查询项目的首选关键字列表。相反,我想均匀地抓取网站并收集代表亚马逊上列出的所有产品的 X 件商品。
有人知道如何以这种方式抓取网站吗?谢谢。
【问题讨论】:
-
您可以考虑浏览每个类别(家具、服装、技术、汽车等)并在那里收集一定数量的物品。但是,这种方法在每个类别在亚马逊总产品中所占的比例上并不具有代表性。尝试为每个类别寻找“X 个结果”标签来弥补这一点?不知道你还能怎么做这个项目,对不起。
-
这是一个有趣的方法。我希望有更多的东西可以让蜘蛛在网站上放开并自行导航。但是,我肯定会使用这种方法。谢谢!
标签: python web-scraping scrapy