【发布时间】:2017-12-27 08:51:12
【问题描述】:
我正在尝试使用 Python、scrapy、selenium 和 phantomjs 从页面 https://arstechnica.com/ 抓取内容。我的程序使用给定参数搜索网站,并提取具有给定关键字的文章的所有链接。问题是可能有太多文章,以至于它们不会出现在 1 页中(例如搜索 heartbleed https://arstechnica.com/search/?ie=UTF-8&q=heartbleed 时)。我的程序现在应该加载第二页并继续提取文章的链接,并重复该过程,直到没有更多页面。问题是,我不知道如何实现它。我愿意接受建议!
注意:
- 没有下一页按钮
- 点击一个新站点(在站点底部的索引上)不会生成一个新的 url,所以我不能告诉 scrapy 打开一个新页面
【问题讨论】:
-
请参阅:How do I do X? SO 的期望是,提出问题的用户不仅会进行研究以回答他们自己的问题,还会分享研究、代码尝试和结果。这表明您已经花时间尝试帮助自己,它使我们免于重复明显的答案,最重要的是它可以帮助您获得更具体和相关的答案!另见:How to Ask
-
你真是太有帮助了!
标签: python selenium scrapy phantomjs