【发布时间】:2021-07-28 01:24:37
【问题描述】:
我正在尝试从此页面抓取数据: https://www.sofascore.com/betting-tips-today
我创建了这段代码但不起作用:
import requests
url = "https://www.sofascore.com/betting-tips-today"
r = requests.get(url).json()
print(r)
我尝试了硒,但不起作用:
from bs4 import BeautifulSoup
import time
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
options = Options()
# options.add_argument("--headless") #headless
options.add_argument('--no-sandbox')
options.add_argument('--ignore-certificate-errors')
options.add_argument('--incognito')
driver = webdriver.Chrome(executable_path=r"C:/chromedriver.exe", options=options)
u = "https://www.sofascore.com/betting-tips-today"
driver.get(u)
WebDriverWait(driver, 20).until(EC.visibility_of_element_located((By.CSS_SELECTOR, "div[class^='Content__PageContainer-sc-']")))
time.sleep(20)
elem = driver.find_element_by_xpath("//*")
source_code = elem.get_attribute("innerHTML")
soup = BeautifulSoup(driver.page_source, 'html.parser')
# print(len(soup.find_all('h2')))
# print(len(soup.select('.ivqpwB')))
parent_soup = soup.find('h2', text=("Odds") ).parent.parent.select('div:nth-of-type(2) > div')
print(len(parent_soup))
for i in parent_soup:
print(i)
知道如何在此页面内抓取数据吗?
【问题讨论】:
-
“不工作”问题是什么?你收到错误了吗?
-
“Cloudflare 的性能和安全性”祝你好运 :-) en.wikipedia.org/wiki/Cloudflare
-
预期输出?
-
“赔率”表中的数据:比赛、比赛赔率、球队、基于赔率的获胜机会、基于历史的获胜机会
标签: python selenium web-scraping beautifulsoup