【发布时间】:2020-05-05 19:34:10
【问题描述】:
我一直在尝试解析来自 https://www.teamrankings.com/nba/team/oklahoma-city-thunder 的 HTML,但无法解析整个页面。我用 BeautifulSoup 尝试了 requests、urllib 和 selenium。它们都不解析完整的 HTML。我得到的最接近的是 urllib(下面的代码)。我尝试了许多不同的用户代理和所有不同的解析器。
如果我在使用 BeautifulSoup 之前打印网页,我可以看到所有内容。一旦我使用 BeautifulSoup,它就会将其中的大部分内容删掉。我尝试过 html.parser、lxml 和 html5。
url = https://www.teamrankings.com/nba/team/oklahoma-city-thunder
req = Request(url, headers={'User-Agent': 'Mozilla/5.0 (iPhone; CPU iPhone OS 5_1 like Mac OS X) AppleWebKit/534.46 (KHTML, like Gecko) Version/5.1 Mobile/9B179 Safari/7534.48.3'})
webpage = urlopen(req).read()
print(webpage)
basketball = BeautifulSoup(webpage)
print(basketball)
提前致谢!
【问题讨论】:
-
究竟是哪个“内容”被截断了?你能在你提供的链接中提供一个例子吗?
-
我无法使用请求和 BeautifulSoup(lxml 解析器)重现此问题。
-
我只获取 3 月及以后的游戏数据...我希望获取所有日期(10 月 - 至今)的所有数据
-
AMC 在使用请求时是否使用了用户代理?
标签: python html beautifulsoup python-requests urllib