【发布时间】:2020-04-23 00:47:40
【问题描述】:
我对使用 beauifulsoup 很陌生,我正在尝试使用下面的代码从网站上抓取文本。 但是,find_all 什么也不返回。
import bs4 as bs
import urllib.request
source = urllib.request.urlopen('https://beta.regulations.gov/document/USCIS-2019-0010-9175').read()
soup = BeautifulSoup(page.content,'html.parser')
text = soup.find_all(class_="px-2")
print(text)
【问题讨论】:
-
可能内容是使用 javascript 检索的
-
内容很可能不在原始来源中,而是由 Javascript 生成的。您可以检查原始页面的来源以查看它是否存在。 BeautifulSoup 无法执行 JS,它只是查看 HTML 源代码。
-
我投票结束这个。数据是在网站上动态生成的,这个确切的问题之前在 Stack Overflow 上已经讨论过很多次。我不相信它会带来任何有价值的东西。
-
涵盖此确切问题的其他问题:stackoverflow.com/q/51117692/11301900、stackoverflow.com/q/55351871/11301900、stackoverflow.com/q/51984646/11301900、stackoverflow.com/q/38334715/11301900、stackoverflow.com/q/44867425/11301900、stackoverflow.com/q/48313615/11301900、stackoverflow.com/q/36060624/11301900、stackoverflow.com/q/57226247/11301900、@98764 @、stackoverflow.com/q/52102257/11301900、stackoverflow.com/q/59205843/11301900。我敢肯定还有更多。
标签: python beautifulsoup