【发布时间】:2018-03-21 08:09:19
【问题描述】:
我正在使用python scrapy获取用户评论cmets,可能有多个页面,我需要点击“查看更多”才能看到更多的cmets。
这是我要抓取的页面的链接: https://en.drivy.com/car-rental/berlin/dacia-dokker-218119
我注意到如果评论 cmets 超过 10 个,我需要单击“查看更多”链接才能获得后续 cmets。 我还注意到“查看更多”的 URL 链接是 https://en.drivy.com/cars/218119/reviews?page=2&rel=next
但是,如果我使用 scrapy 访问 https://en.drivy.com/cars/218119/reviews?page=2&rel=next,网站会将我重定向回 https://en.drivy.com /car-rental/berlin/dacia-dokker-218119 我真的无法获得接下来的十个 cmets。 (我想知道网站是否使用 cookie 或会话 ID 并将我的 scrapy 识别为新访问)
我知道我可以使用python selenium打开网页并单击“查看更多”以获取cmets,但是selenium非常慢,我希望我可以使用scrapy。
有人可以帮我解决这个问题吗?或者至少给我一个前进的方向?提前致谢。
【问题讨论】:
标签: python pagination scrapy