【发布时间】:2019-09-05 22:35:23
【问题描述】:
我是网络抓取/编码的新手,我正在尝试使用 Python 请求/BeautifulSoup 来解析 html 代码以获得一些物理和化学特性。
出于某种原因,虽然我在其他网站上成功使用了以下脚本,但 BeautifulSoup 只打印了从页眉和页脚开始的几行,然后是几页没有真正意义的 HTML 代码。这是我一直在使用的代码:
import requests
from bs4 import BeautifulSoup
url='https://comptox.epa.gov/dashboard/dsstoxdb/results?search=ammonia#properties'
response = requests.get(url).text
soup=BeautifulSoup(response,'lxml')
print(soup.prettify())
当我尝试查找表甚至一行时,它没有输出。有什么我没有考虑到的吗?任何帮助将不胜感激!
【问题讨论】:
-
您是否尝试阅读此页面的来源?它看起来像您输出的内容吗?答案是肯定的,因为这个网站正在使用某种 dom 操纵器来加载内容,除非你能解释 javascript,否则你将无法从这里删除任何内容
-
我使用 selenium 通过 javascript 拉出页面或与它们交互。 Selenium 还允许在给定网页上进行点击和其他操作
标签: python web-scraping beautifulsoup python-requests