【问题标题】:How to scrape data from multiple unrelated sections of a website (using Scrapy)如何从网站的多个不相关部分抓取数据(使用 Scrapy)
【发布时间】:2020-12-14 15:50:01
【问题描述】:

我制作了一个可以抓取亚马逊的 Scrapy 网络爬虫。它可以通过使用关键字列表搜索项目并从结果页面中抓取数据来进行抓取。

但是,我想从亚马逊获取大部分产品数据。我没有用于查询项目的首选关键字列表。相反,我想均匀地抓取网站并收集代表亚马逊上列出的所有产品的 X 件商品。

有人知道如何以这种方式抓取网站吗?谢谢。

【问题讨论】:

  • 您可以考虑浏览每个类别(家具、服装、技术、汽车等)并在那里收集一定数量的物品。但是,这种方法在每个类别在亚马逊总产品中所占的比例上并不具有代表性。尝试为每个类别寻找“X 个结果”标签来弥补这一点?不知道你还能怎么做这个项目,对不起。
  • 这是一个有趣的方法。我希望有更多的东西可以让蜘蛛在网站上放开并自行导航。但是,我肯定会使用这种方法。谢谢!

标签: python web-scraping scrapy


【解决方案1】:

我将我的评论作为答案,以便寻找类似解决方案的其他人可以更轻松地找到它。

实现这一目标的一种方法是浏览每个类别(家具、服装、技术、汽车等)并在那里收集一定数量的物品。亚马逊的侧边/顶部栏带有指向不同类别的导航链接,因此您可以让它在那里运行。

流程如下:

  1. 从最初的 Amazon.com 解析中关注类别 URL
  2. 对回调使用不同的解析函数,该函数将抓取该类别中的许多项目
  3. 确保数据正在写入文件(可能会有很多数据)

但是,这种方法在每个类别在亚马逊总产品中所占的比例上并不具有代表性。尝试为每个类别寻找“X 个结果”标签来弥补这一点。祝你的项目好运!

【讨论】:

    猜你喜欢
    • 2015-01-15
    • 1970-01-01
    • 2013-03-08
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-09
    • 2020-10-12
    • 2019-11-16
    相关资源
    最近更新 更多