【发布时间】:2018-12-18 05:33:41
【问题描述】:
我目前正在开发一个网络抓取工具,以从我学校的报纸网站上下载信息,以便重新上传到我们即将推出的新网站。现在我正在测试如何使用 bs4 从网页下载图像。但是,正如我在下面的代码中所解释的,我无法找到图片的“src”标签,也就是 url,以便下载图片。
import requests, bs4
url = 'https://www.behrendbeacon.com/parkingconcernsaddressed'
res = requests.get(url)
res.raise_for_status()
soup = bs4.BeautifulSoup(res.text)
imgElems = soup.select('img')
print(imgElem[2])
# prints <img alt="18160.jpeg" data-type="image" id="comp-jpa6qz48imgimage"/>
所以为了进一步解释:
1.) 如果您使用开发人员工具访问 url 并检查网页,您会明白 imgElem[2] 是我要抓取的新闻文章中的主要图片。下面是一张图片来说明我的意思:
Here's the web page screenshot
2.) 我打印 imgElem[2] 的原因是为了证明 Beautiful Soup 不会使用其余数据抓取“src”标签
简而言之,有人可以解释我错过了什么吗?这种无法获取“src”标签的原因是否在于该网站是一个 Wix 网站?感谢您提供的任何帮助
【问题讨论】:
标签: python beautifulsoup src