【发布时间】:2013-12-08 02:50:14
【问题描述】:
我正在尝试从网络上抓取图像信息,我想知道是否有任何方法可以提取图像文件名。例如,如果以下 HTML 表达式存储在源代码中,
<img src=http://www.adbongo.com/wp-content/uploads/2013/09/digital-bongo.jpg>,
我想提取digital-bongo.jpg 部分。
谢谢,
【问题讨论】:
-
使用 HTML 解析器?当然,我会避免使用正则表达式。
-
嗯...这实际上可能是一个更好的主意...谢谢。
-
该条目是否可能只是
<img src="digital-bongo.jpg">?或者<img src="http://mysite/imgejpg.jpg">怎么样?如果是这样,那么src=["']?(?:.*/|/)?(.*(?:png|jpg|gif))(?:\1)?.*>
标签: python regex web-crawler