【发布时间】:2015-10-19 10:19:58
【问题描述】:
我感兴趣的数据的网页有一些 XHR 请求。 我已经使用开发人员工具获得了 XHR 请求的 url。 现在如何在我的 spider.py 文件中实现相同的功能以及如何获取其中的所有值。我从scrapy 开始,不知道像这样使用 ajax 发布请求。请指导我如何获取数据并希望将可用字段存储在 Excel 文件中。
【问题讨论】:
标签: python ajax xmlhttprequest scrapy
我感兴趣的数据的网页有一些 XHR 请求。 我已经使用开发人员工具获得了 XHR 请求的 url。 现在如何在我的 spider.py 文件中实现相同的功能以及如何获取其中的所有值。我从scrapy 开始,不知道像这样使用 ajax 发布请求。请指导我如何获取数据并希望将可用字段存储在 Excel 文件中。
【问题讨论】:
标签: python ajax xmlhttprequest scrapy
您需要从脚本内部模拟网络请求。为此,您可以执行以下操作:
url = 'your url string'
req = scrapy.Request(url,
method='POST',
body='{"filters": []}',
headers={'X-Requested-With': 'XMLHttpRequest',
'Content-Type': 'application/json; charset=UTF-8'},
callback=self.parser2)
yield req
这只是一个示例,可能不符合您的确切用例。您需要调查实际请求以确定要发送的标头、正文以及是否要进行回调。
【讨论】:
POST 请求中发送到服务器的参数很多。您必须找到它们中的最小集合,以使您的应用程序清晰易读。