【问题标题】:Img scraping using bs4 and selenium使用 bs4 和 selenium 进行 Img 抓取
【发布时间】:2018-11-08 14:18:03
【问题描述】:

我正在尝试使用 selenium 和 bs4 从 IG 抓取一些 img 文件。我有以下脚本可以执行此操作,它似乎工作正常,但最终我希望它只打印img src,一个示例:https://scontent-lax3-2.cdninstagram.com/vp/2592f6b07f88bfc4bfdf6d73400a04b8/5BA6E998/t51.2885-15/s640x640/sh0.08/e35/28752330_1972627949433283_1816022201220988928_n.jpg 并稍后下载图像。但是现在我需要一些帮助来打印没有标签和附加内容的 img src 链接。谢谢你的建议。

代码:

import requests
from bs4 import BeautifulSoup
import selenium.webdriver as webdriver

url = ('https://www.instagram.com/kitties/')
driver = webdriver.Firefox()
driver.get(url)

soup = BeautifulSoup(driver.page_source, 'lxml')

img_url = soup.find_all('img', class_='_2di5p')

print img_url

【问题讨论】:

  • 它现在做什么?
  • 它打印所有的html标签和尺寸等@pydude

标签: python selenium beautifulsoup


【解决方案1】:

只需打印出找到图像的src

imgs= soup.find_all('img', class_='_2di5p')
for img in imgs:
    img_url=img["src"]
    print img_url

【讨论】:

  • 见鬼,就是这样。完全忘记了我可以这样做。谢谢!投票给@pydude
猜你喜欢
  • 2020-09-04
  • 2019-02-12
  • 2019-03-12
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2019-02-07
  • 1970-01-01
相关资源
最近更新 更多