【发布时间】:2016-04-18 07:36:04
【问题描述】:
我在这里阅读了一些相关的帖子,但找不到答案。
我正在尝试抓取带有评论的网页。访问网站时,最初只有 10 条评论,用户每次滚动时都应按“显示更多”以获得更多 10 条评论(这也将 #add10 添加到网站地址的末尾)一直到评论列表的末尾。实际上,用户可以通过将 #add1000(其中 1000 是附加评论的数量)添加到网站地址的末尾来获得完整的评论列表。问题是我在我的蜘蛛中使用 site_url#add1000 只能获得前 10 条评论,就像使用 site_url 一样,所以这种方法不起作用。
我也找不到一种方法来做出适当的请求来模仿来自站点的原始请求。原始 AJAX url 的格式为“domain/ajaxlst?par1=x&par2=y”,我尝试了所有这些:
Request(url='domain/ajaxlst?par1=x&par2=y', callback=self.parse_all)
Request(url='domain/ajaxlst?par1=x&par2=y', callback=self.parse_all,
headers={all_headers})
Request(url='domain/ajaxlst?par1=x&par2=y', callback=self.parse_all,
headers={all_headers}, cookies={all_cookies})
但每次我收到 404 错误。谁能解释我做错了什么?
【问题讨论】: