【发布时间】:2019-12-16 22:02:11
【问题描述】:
我正在尝试从以下站点抓取幻想玩家数据:http://www.fplstatistics.co.uk/。该表格在打开网站时出现,但在我抓取网站时不可见。
我尝试了以下方法:
import requests as rq
from bs4 import BeautifulSoup
fplStatsPage = rq.get('http://www.fplstatistics.co.uk')
fplStatsPageSoup = BeautifulSoup(fplStatsPage.text, 'html.parser')
fplStatsPageSoup
桌子也不见了。代替桌子应该在哪里的东西是:
<div>
The 'Player Data' is out of date.
<br/> <br/>
You need to refresh the web page.
<br/> <br/>
Press F5 or hit <i class="fa fa-refresh"></i>
</div>
只要表格更新,此消息就会出现在网站上。
然后我查看了开发人员工具,看看是否可以找到检索表数据的 URL,但我没有运气。可能是因为我不知道如何很好地阅读开发人员工具。
然后我尝试使用 Selenium 刷新页面,如上述消息所示:
from selenium import webdriver
import time
chromeDriverPath = '/Users/SplitShiftKing/Downloads/Software/chromedriver'
driver = webdriver.Chrome(chromeDriverPath)
driver.get('http://www.fplstatistics.co.uk')
driver.refresh()
#To give site enough time to refresh
time.sleep(15)
html = driver.page_source
fplStatsPageSoup = BeautifulSoup(html, 'html.parser')
fplStatsPageSoup
输出与以前相同。该表出现在网站上,但不在输出中。
我们将不胜感激。我已经查看了关于溢出的类似问题,但我一直无法找到解决方案。
【问题讨论】:
标签: python web-scraping beautifulsoup selenium-chromedriver