【发布时间】:2013-04-09 02:25:14
【问题描述】:
我正在用 Scrapy 编写我的第一个蜘蛛并尝试遵循文档。我已经实现了 ItemLoaders。蜘蛛提取数据,但数据包含许多行返回。我尝试了很多方法来删除它们,但似乎没有任何效果。 replace_escape_chars 实用程序应该可以工作,但我不知道如何将它与ItemLoader 一起使用。也有些人使用(unicode.strip),但同样,我似乎无法让它工作。有些人尝试在 items.py 中使用这些,而其他人则在蜘蛛中使用。如何清理这些线路返回的数据 (\r\n)?我的 items.py 文件仅包含项目名称和 field()。蜘蛛代码如下:
from scrapy.spider import BaseSpider
from scrapy.selector import HtmlXPathSelector
from scrapy.contrib.loader import XPathItemLoader
from scrapy.utils.markup import replace_escape_chars
from ccpstore.items import Greenhouse
class GreenhouseSpider(BaseSpider):
name = "greenhouse"
allowed_domains = ["domain.com"]
start_urls = [
"http://www.domain.com",
]
def parse(self, response):
items = []
l = XPathItemLoader(item=Greenhouse(), response=response)
l.add_xpath('name', '//div[@class="product_name"]')
l.add_xpath('title', '//h1')
l.add_xpath('usage', '//li[@id="ctl18_ctl00_rptProductAttributes_ctl00_liItem"]')
l.add_xpath('repeat', '//li[@id="ctl18_ctl00_rptProductAttributes_ctl02_liItem"]')
l.add_xpath('direction', '//li[@id="ctl18_ctl00_rptProductAttributes_ctl03_liItem"]')
items.append(l.load_item())
return items
【问题讨论】:
-
查看this 示例蜘蛛代码。请注意
parse方法中如何使用处理器。希望对您有所帮助。
标签: web-scraping scrapy