【发布时间】:2014-04-30 09:00:18
【问题描述】:
我对 perl 很陌生,我正在尝试从网站上收集链接和图像。我目前正在阅读有关regular expressions 的信息,到目前为止,我已经设法获得了包含链接或图像(至少我相信如此)的 html 行
/<img src|<a href/i #I'm just comparing every line of html to this
但是如何捕获和存储实际的 url?基本上变成这样:
<img src="http://i1.nyt.com/images/2014/03/23/us/23marriage2/23marriage2-largeHorizontal375.jpg"
进入这个:
http://i1.nyt.com/images/2014/03/23/us/23marriage2/23marriage2-largeHorizontal375.jpg
【问题讨论】:
-
您可能会考虑解析数据,而不是将其视为匹配正则表达式的文本字符串。 HTML 的排列比任何正则表达式都能够匹配的要多得多。 search.cpan.org/~msergeant/XML-Parser-2.36/Parser.pm
标签: html regex perl web-scraping