【问题标题】:Chrome extension webscraper.io - how does pagination work with selecting "next"Chrome 扩展 webscraper.io - 分页如何与选择“下一步”一起工作
【发布时间】:2019-04-25 02:58:22
【问题描述】:

我正在尝试使用 google chrome 扩展程序 webscraper.io 抓取网站的表格。在扩展的教程中,记录了如何抓取具有不同页面的网站,例如“第 1 页”、“第 2 页”和“第 3 页”,其中每个页面都直接链接在主页上。

然而,在website I am trying to scrape 的示例中,只有一个“下一步”按钮可以访问下一个站点。如果我按照教程中的步骤为“下一页”页面创建一个链接,它只会考虑第 1 页和第 2 页。为每个页面创建一个“下一个”链接是不可行的,因为它们太多了。如何让网络爬虫包含所有页面?有没有办法使用 webscraper 扩展来循环浏览页面?

我知道这可能是重复的:pagination Chrome web scraper。但是,它并没有得到很好的接受,并且没有包含有用的答案。

【问题讨论】:

    标签: google-chrome pagination web-scraping


    【解决方案1】:

    按照高级文档here,通过将“分页”链接设为自己的父级来解决问题。然后,抓取软件将递归地遍历所有页面及其“下一页”。用他们的话说,

    要从所有分页链接中提取项目,包括开始时不可见的项目,您需要创建另一个链接选择器来选择分页链接。图 2 显示了应如何在站点地图中创建链接选择器。当刮板打开一个类别链接时,它将提取页面中可用的项目。之后,它将找到分页链接并访问这些链接。如果分页链接选择器成为其自身的子节点,它将递归地发现所有分页页面。

    【讨论】:

    • 如果某些东西也需要成为其他页面的子元素,我如何才能让它成为它自己的子元素?
    • 说明很不清楚,我看不出有什么方法可以复制他们的图表。
    • 我想通了。有些东西可能是不止一个父母的孩子,这没有明确说明。选择父母时按 cntl 有效。
    • 他们在他们的教程中解释了如何做到这一点,在 2:42 你会看到一个示例图:youtube.com/watch?v=y_n2IsZlLds
    • 是否可以在命令行环境中重用依赖图(例如使用无头浏览器?)
    猜你喜欢
    • 1970-01-01
    • 2018-06-13
    • 1970-01-01
    • 2016-01-22
    • 1970-01-01
    • 2020-02-27
    • 2011-05-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多