【发布时间】:2017-10-03 01:19:26
【问题描述】:
我想获取 (http://mokorea.com/yp_business_list_major.php?cat=4) 上的所有商家名称链接
这是我的 Python 代码:
from __future__ import unicode_literals
import requests
from scrapy.selector import Selector
def fetch_page(url):
'''1. 웹페이지 다운로드'''
r = requests.get(url)
return r.text
def upso_list_from_listpage(url):
'''2.목록 페이`enter code here`지에서 강의 링크등 추출'''
html = fetch_page(url)
sel = Selector(text=html)
upso_list = sel.xpath('//*[@id="List_0"]/div[4]').extract()
#upso_list = sel.css('.container results .talk-link .media__message a::attr(herf)').extract()
return upso_list
from pprint import pprint
pprint(upso_list_from_listpage('http://mokorea.com/yp_business_list_major.php?cat=4'))
我尝试在提示符下运行 py 文件,但没有任何显示。
任何 cmets 都会有所帮助。
【问题讨论】:
-
你能复制那个网站的html结构让我们看看吗?
-
您可以使用以下在线工具针对您的 HTML 测试您的 xpath 模式:videlibri.sourceforge.net/cgi-bin/xidelcgi
-
这是AJAX生成的页面,你应该使用Selenium或类似的东西。
标签: python web-scraping request scrapy web-crawler