【发布时间】:2017-07-07 04:50:57
【问题描述】:
我想从网站上通过 scrapy 获取文本。这是示例代码:
def parse(self, response):
for kamusset in response.css("div#d1"):
text = kamusset.css("div b::text").extract()
print(dict(text=text))
我想删除 '.'符号和每个数字符号。所以,我使用正则表达式。我更改了我的代码:
def parse(self, response):
for kamusset in response.css("div#d1"):
text = kamusset.css("div b::text").re(r'[a-z]+')
print(dict(text=text))
我不希望这样的结果。我想变成这样:
{'text': ['abadi', 'mengabadi', 'mengabadikan', 'pengabadian', 'keabadian']}。该怎么做?
【问题讨论】:
标签: python regex scrapy web-crawler