【问题标题】:Python html parsing using beautiful soup issuesPython html 解析使用漂亮的汤问题
【发布时间】:2021-01-23 22:33:11
【问题描述】:

我正在尝试使用 beautifulsoup 从https://www.devex.com/organizations/search 获取所有组织的名称。但是,我遇到了错误。有人可以帮忙吗?

导入请求 从请求导入获取 从 bs4 导入 BeautifulSoup 将熊猫导入为 pd 将 numpy 导入为 np

从时间导入睡眠 从随机导入randint

headers = {"Accept-Language": "en-US,en;q=0.5"}

标题 = [] pages = np.arange(1, 2, 1)

页面中的页面:

page = requests.get("https://www.devex.com/organizations/search?page%5Bnumber%5D=" + str(page) + "", headers=headers)

soup = BeautifulSoup(page.text, 'html.parser') movie_div = soup.find_all('div', class_='info-container')

睡眠(randint(2,10))

movie_div 中的容器:

    name = container.a.find('h3', class_= 'ng-binding').text
    titles.append(name)
    

电影 = pd.DataFrame({ “电影”:标题,

})

查看您的数据框

打印(电影)

查看列的数据类型

打印(movies.dtypes)

查看丢失数据的位置以及丢失的数据量

打印(movies.isnull().sum())

将所有抓取的数据移至 CSV 文件

movies.to_csv('movies.csv')

【问题讨论】:

  • 在问题中提及您遇到的错误

标签: python html parsing beautifulsoup


【解决方案1】:

你可以试试

name = bs.find("h3", {"class": "ng-binding"})

【讨论】:

    猜你喜欢
    • 2017-05-23
    • 1970-01-01
    • 2013-03-21
    • 2015-07-03
    • 2018-11-03
    • 1970-01-01
    • 2021-03-28
    • 2021-03-06
    • 1970-01-01
    相关资源
    最近更新 更多