【发布时间】:2011-06-26 01:24:03
【问题描述】:
我想从 html 页面中提取所有锚标记。我在 Linux 中使用它。
lynx --source http://www.imdb.com | egrep "<a[^>]*>"
但这并没有按预期工作,因为结果包含不需要的结果
<a class="amazon-affiliate-site-name" href="http://www.fabric.com">Fabric</a><br>
我只想
<a href >...</a>
有什么好办法吗?
【问题讨论】:
-
不要使用正则表达式来解析 html。阅读stackoverflow.com/questions/1732348/…
-
对一个技术问题给出喜剧演员,甚至没有真正的答案有什么用?
标签: regex linux bash grep lynx