【发布时间】:2020-12-15 12:37:42
【问题描述】:
我正在尝试用简单的信息抓取一个页面。
我正在使用 BeautifulSoup 来抓取数据。但是在页面中有一个隐藏电子邮件信息的按钮。因此,我尝试使用 Selenium 来小鸡,然后使用 BeautifulSoup 抓取数据。但我真的不知道该怎么做。
我做到了:
import requests, time, re
from bs4 import BeautifulSoup
from selenium import webdriver
url = "https://acukwik.com/Basic-Info/UUBP/RUSAERO"
driver = webdriver.Chrome()
driver.get(url)
while True:
soup = BeautifulSoup(driver.page_source, 'html5lib')
divEmail = soup.find('div', text=re.compile('Email'))
try:
driver.find_elements_by_class_name('ghEmail').click()
time.sleep(3)
email = divEmail.findNext('a')['href']
print(email)
except:
break
driver.quit()
发生的情况是 Chrome 页面在给定的 url 中打开,但没有任何反应。它只是打开和关闭。我没有看到按钮发生变化。
我做错了什么?以及如何获取这些数据?我可以只用 BeautifulSoup 吗?
【问题讨论】:
标签: python python-3.x selenium web-scraping beautifulsoup