【发布时间】:2021-01-23 22:33:11
【问题描述】:
我正在尝试使用 beautifulsoup 从https://www.devex.com/organizations/search 获取所有组织的名称。但是,我遇到了错误。有人可以帮忙吗?
导入请求 从请求导入获取 从 bs4 导入 BeautifulSoup 将熊猫导入为 pd 将 numpy 导入为 np
从时间导入睡眠 从随机导入randint
headers = {"Accept-Language": "en-US,en;q=0.5"}
标题 = [] pages = np.arange(1, 2, 1)
页面中的页面:
page = requests.get("https://www.devex.com/organizations/search?page%5Bnumber%5D=" + str(page) + "", headers=headers)
soup = BeautifulSoup(page.text, 'html.parser') movie_div = soup.find_all('div', class_='info-container')
睡眠(randint(2,10))
movie_div 中的容器:
name = container.a.find('h3', class_= 'ng-binding').text
titles.append(name)
电影 = pd.DataFrame({ “电影”:标题,
})
查看您的数据框
打印(电影)
查看列的数据类型
打印(movies.dtypes)
查看丢失数据的位置以及丢失的数据量
打印(movies.isnull().sum())
将所有抓取的数据移至 CSV 文件
movies.to_csv('movies.csv')
【问题讨论】:
-
在问题中提及您遇到的错误
标签: python html parsing beautifulsoup