【发布时间】:2014-06-11 13:41:09
【问题描述】:
我为scrapy写了一个python类,如下:
from scrapy.item import Item, Field
from scrapy.spider import Spider
from scrapy.selector import Selector
class MyItem(Item):
content = Field()
class TestSpider(Spider):
name = 'test_spider'
allowed_domains = ['www.hamshahrionline.ir']
start_urls = ['http://www.hamshahrionline.ir/']
def parse(self, response):
sel = Selector(response)
h4 = sel.xpath("//h4/a/text()").extract()
for t4 in h4:
title4 = MyItem()
title4['content'] = t4
yield title4
我想知道如何挖掘到该内容的链接并浏览其他页面?
第二个问题:
您能告诉我如何从网站上逐页查看链接的内容吗?
【问题讨论】:
标签: python web-scraping scrapy web-crawler