【发布时间】:2020-07-27 21:56:39
【问题描述】:
你好!
我正在英超联赛网站上进行一些抓取,但遇到了以下问题。当我运行这个时:
my_url = 'https://www.premierleague.com/match/{}'.format(i)
client = urlopen(my_url)
page_html = client.read()
page_html 的这个特定部分是这样返回的:
<div class="matchDate renderMatchDateContainer" data-kickoff="1583784000000"></div>
当它应该是这样的时候,正如我在浏览器上看到的那样:
<div class="matchDate renderMatchDateContainer" data-kickoff="1583784000000">Mon 9 Mar 2020</div>
因此,我无法抓取日期“2020 年 3 月 9 日星期一”。
有人可以帮忙吗?谢谢!
【问题讨论】:
-
你在格式化什么?
.format(i)?你能发布更多代码吗 -
如果页面使用 JavaScript 添加数据,那么您需要 Selenium 而不是 BS 和 urllib,因为 BS 和 urllib 无法运行 JavaScript。
-
嗨@0m3r。
.format(i)只是为了让我可以使用 for 循环访问多个页面。每个网址都是这样的:premierleague.com/match/46605 -
嗨@furas。我真的不知道该页面是否使用 JavaScript,但我能够使用 BS 抓取大量数据。我只是在纠结日期和时间。
标签: python html web-scraping beautifulsoup urllib