【发布时间】:2018-10-26 01:41:06
【问题描述】:
所以我打算抓取这个网站,这样我就可以获得每支英超球队的阵容数据。有人可以帮助我如何做到这一点吗?在这个 URL 下,在 Premier League 标题下,我可以看到一堆 UI 标签中的球队列表。
我还注意到每个团队的 URL 都是这样的 - https://www.skysports.com/arsenal,在该页面内,小队的链接看起来像 - https://www.skysports.com/arsenal-squad。
但这也适用于非超级联赛球队。
最初,我还能够为球队及其积分等抓取英超联赛表并将其放入 csv 中。所以也许我可以使用它来构建 URL 以获取各个球队的数据。 ?例如,以下是我在 csv 中的内容
位置,团队,Pl,W,D,L,F,A,GD,Pts 1,曼彻斯特城,9,7,2,0,26,3,23,23 2,利物浦,9,7,2,0,16,3,13,23
【问题讨论】:
-
使用母版页上的链接来解析详细页的正确地址,而不是猜测 URL。
-
是的,我想我从一开始就无法想象我将如何解决这个问题的架构。我的问题实际上是从高层次来看我需要做什么
标签: python web-scraping beautifulsoup