【发布时间】:2017-04-26 03:39:07
【问题描述】:
我是 Scrapy 框架的新手,正在尝试学习网络抓取 我有一个包含网站页面链接的 txt 文件,我正在制作这些链接的列表并将它们存储在 start_urls 但解析功能不起作用并且它没有抓取任何东西
这里是代码
try:
import scrapy
except ImportError:
print "\nERROR IMPORTING THE NESSASARY LIBRARIES\n"
#File with all the links
crimefile = open('links.txt', 'r')
#making a list with all the links
yourResult = [line for line in crimefile.readlines()]
class SpiderMan(scrapy.Spider):
name = 'man spider'
#making start_urls equal to that list
start_urls = yourResult
def parse(self, response):
SET_SELECTOR = '.c411Listing.jsResultsList'
for man in response.css(SET_SELECTOR):
name = '.c411ListedName a ::text'
address = '.adr ::text'
phone = '.c411Phone ::text'
yield {
'NAME': man.css(name).extract_first(),
'ADDRESS': man.css(address).extract_first(),
'PHONE': man.css(phone).extract_first(),
}
ad 是输出,由于某种原因解析功能不起作用,但抓取正在抓取每个链接
我做错了什么?在这个简单的代码中?
【问题讨论】:
-
在scrapy shell中我得到了结果,你试过调试吗?你是怎么跑scrapy的?。
标签: python web-scraping scrapy scrapy-spider