【问题标题】:Python/Scrapy/ - Scraping from ArstechnicaPython/Scrapy/ - 从 Arstechnica 抓取
【发布时间】:2017-12-27 08:51:12
【问题描述】:

我正在尝试使用 Python、scrapy、selenium 和 phantomjs 从页面 https://arstechnica.com/ 抓取内容。我的程序使用给定参数搜索网站,并提取具有给定关键字的文章的所有链接。问题是可能有太多文章,以至于它们不会出现在 1 页中(例如搜索 heartbleed https://arstechnica.com/search/?ie=UTF-8&q=heartbleed 时)。我的程序现在应该加载第二页并继续提取文章的链接,并重复该过程,直到没有更多页面。问题是,我不知道如何实现它。我愿意接受建议!

注意:
- 没有下一页按钮
- 点击一个新站点(在站点底部的索引上)不会生成一个新的 url,所以我不能告诉 scrapy 打开一个新页面

【问题讨论】:

  • 请参阅:How do I do X? SO 的期望是,提出问题的用户不仅会进行研究以回答他们自己的问题,还会分享研究、代码尝试和结果。这表明您已经花时间尝试帮助自己,它使我们免于重复明显的答案,最重要的是它可以帮助您获得更具体和相关的答案!另见:How to Ask
  • 你真是太有帮助了!

标签: python selenium scrapy phantomjs


【解决方案1】:

快速浏览一下 Chrome 开发者工具/网络选项卡,结果似乎是通过https://www.googleapis.com/customsearch/v1element 调用 Google API 自定义搜索提供的,它以 JSON 格式返回结果。您可以看到传递的 URL 参数,并且基本上将其用于您的 start_urls

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2017-09-04
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-23
    • 2014-07-27
    • 1970-01-01
    • 2015-01-15
    相关资源
    最近更新 更多