【发布时间】:2017-06-13 18:19:37
【问题描述】:
我正在编写一个用于迭代“下一页”爬取的爬虫爬虫。 我的代码是这样的:
def parse(self, response):
while self.current_page<=self.total_page:
self.current_page = int(self.selector.css("something").extract()[-1])
for post_node in self.selector.css("div.info-column"):
yield {
"location": post_node.css("something").extract(),
}
logging.info("************** now page is %d **************", self.current_page)
logging.info("********** one page done,Going to next **********")
try:
self.next.send_keys('\n')
我希望代码爬取每个页面的信息,然后点击下一页。但是打印的调试信息显示它经常跳过一些页面。
可能是什么原因?
【问题讨论】: