【问题标题】:Python web crawler [closed]Python网络爬虫[关闭]
【发布时间】:2012-07-26 13:29:28
【问题描述】:

是否有任何 python 爬虫可以从网页中提取所有数据,例如:http://www.bestbuy.com/site/HTC+-+One+S+4G+Mobile+Phone+-+Gradient+Blue+%28T-Mobile%29/4980512.p?id=1218587135819&skuId=4980512&contract_desc= 在此页面中,客户评论有两个页面 1 和 2。我想爬取他的 url 并获取两个页面的内容。这可以通过 python 爬虫实现吗?

python 爬虫也支持所有现代 GET/POST 技术

【问题讨论】:

  • 相反,您可以查看百思买是否有适合您的 API。

标签: python web-crawler


【解决方案1】:

你可以使用Scrapy:

Scrapy 是一个快速的高级屏幕抓取和网络抓取框架,用于抓取网站并从其页面中提取结构化数据。它可用于广泛的用途,从数据挖掘到监控和自动化测试。

【讨论】:

    【解决方案2】:

    如果您想抓取网站,请参阅this post。如果您只想处理一些页面并分析其内容(意味着您知道要处理的 URL),请尝试BeautifulSoup,它允许您执行以下操作:

    page = urllib2.urlopen(url)
    soup = BeautifulSoup(page.read())
    for f in soup.findAll('form'):
        target_url = f['action']
        #do something with each one of the forms
    

    【讨论】:

      猜你喜欢
      • 2011-07-07
      • 2023-04-01
      • 1970-01-01
      • 1970-01-01
      • 2015-05-12
      • 1970-01-01
      • 2011-05-15
      • 1970-01-01
      • 2013-10-15
      相关资源
      最近更新 更多