【发布时间】:2014-04-26 06:26:15
【问题描述】:
我正在制作用于抓取网站的scrapy,但该网站正在使用cookies,我不知道如何使用cookies制作用于抓取网站数据的指令
class DmozSpider(Spider):
name = "dmoz"
allowed_domains = ["dmoz.org"]
start_urls = [
"http://www.dmoz.org/Computers/Programming/Languages/Python/Books/"
]
def parse(self, response):
sel = Selector(response)
sites = sel.HtmlXPathSelector('//ul[@class="directory-url"]/li')
items = []
for site in sites:
item = Website()
item['name'] = site.xpath('a/text()').extract()
item['url'] = site.xpath('a/@href').extract()
items.append(item)
return items
如何将 cookie 正确添加到此网址
【问题讨论】:
标签: python cookies xpath web-scraping scrapy