【发布时间】:2020-05-06 23:52:30
【问题描述】:
我正在开发我的第一个 Python 项目,使用 BeautifulSoup 从https://www.tva.com/Environment/Lake-Levels/South-Holston 抓取数据。我了解网络抓取的基础知识,并且一直在关注 YouTube 教程。我在尝试从上述 URL 中提取数据时遇到了问题。
from bs4 import BeautifulSoup
import requests
URL = requests.get('https://www.tva.com/Environment/Lake-Levels/South-Holston')
soup = BeautifulSoup(URL,'lxml')
main_body = soup.body.div
print(main_body.prettify())
我使用上面的基本代码来解析网站主体的页面。在打印出解析的内容并将其与 Google Chrome 上的源代码进行比较后,我注意到某些元素丢失了。我试图解析的数据(Generation Releases 下的生成器)位于 HTML 类 <div class="tvawidget"... 内的表中。将解析后的数据与源代码进行比较时,会发现表中的数据和表本身与function display(data) 进行了交换。我希望所有这些都不会太令人困惑,如果我需要澄清,请告诉我。
【问题讨论】:
标签: python beautifulsoup