【问题标题】:How to loop through each page of website for web scraping with BeautifulSoup如何使用 BeautifulSoup 循环浏览网站的每个页面以进行网络抓取
【发布时间】:2017-09-20 23:04:25
【问题描述】:

我正在使用 BeautifulSoup 从网站上抓取招聘信息。我有可以满足我需要的工作代码,但它只会抓取职位发布的第一页。我无法弄清楚如何迭代更新 url 以抓取每个页面。我是 Python 新手,已经研究了一些针对类似问题的不同解决方案,但还没有弄清楚如何将它们应用于我的特定 url。我想我需要迭代更新 url 或以某种方式单击下一步按钮,然后在每个页面中循环我现有的代码。我感谢任何解决方案。

网址:https://jobs.utcaerospacesystems.com/search-jobs

【问题讨论】:

  • 打开浏览器开发者控制台的网络标签,你会看到它在后台发送ajax请求

标签: python html web-scraping beautifulsoup


【解决方案1】:

首先,BeautifulSoup 与获取网页没有任何关系——您自己获取网页,然后将其提供给 bs4 进行处理。

您链接的页面的问题在于它是 javascript - 它只能在浏览器(或任何其他 javascript VM)中正确呈现。

@Fabricator 走在正确的轨道上——你需要观察开发者控制台并查看 ajax 请求 js 发送到服务器的内容。在这种情况下,还请查看查询字符串参数,其中包括一个名为 CurrentPage 的参数 - 这可能是您要关注的参数。

【讨论】:

  • 谢谢...我认为我的编码知识还不够先进,无法做到这一点,但是,嘿!至少我从第一页刮掉了我需要的东西(哈哈)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2022-11-30
  • 1970-01-01
  • 2020-11-15
  • 1970-01-01
相关资源
最近更新 更多