【问题标题】:Scraping HTML data from website in Python用 Python 从网站上抓取 HTML 数据
【发布时间】:2016-10-12 10:49:32
【问题描述】:

我正在尝试从某些网站抓取某些 HTML 数据,但我似乎无法抓取我想要的部分。例如,我为自己设定了从this blog 获取关注者数量的挑战,但我似乎做不到。

我尝试过使用 urllib、request、beautifulsoup 以及 Jam API

这是我的代码目前的样子:

from bs4 import BeautifulSoup
from urllib import urlopen
import json
import urllib2

html = urlopen('http://freelegalconsultancy.blogspot.co.uk/')
soup = BeautifulSoup(html, "lxml")
print soup

我将如何在这个实例中拉取关注者的数量?

【问题讨论】:

    标签: python html


    【解决方案1】:

    您无法抓取关注者,因为它是由 javascript 加载的小部件。您需要通过 css 类或 id 或元素来获取部分 html。

    例如:

    from bs4 import BeautifulSoup
    from urllib import urlopen
    
    html = urlopen('http://freelegalconsultancy.blogspot.co.uk/')
    soup = BeautifulSoup(html)
    
    assert soup.h1.string == '\nLAW FOR ALL-M.MURALI MOHAN\n'
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2018-09-01
      • 2022-01-23
      • 1970-01-01
      • 1970-01-01
      • 2016-11-28
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多