【发布时间】:2014-10-03 15:57:46
【问题描述】:
我正在尝试从以下内容中提取“页面名称”:
<a class="timetable work" href="http://www.test.com/pagename?tag=meta376">Test</a>
我尝试使用“sed”让它工作,但它只显示无效的命令代码。
你们建议使用哪一行代码来获取页面名称?顺便说一句:这不是一行,但同一行上有更多内容 - 但这不应该有所作为,因为限制器之间应该有什么关系,对吧?
提前感谢您帮助我!
【问题讨论】:
-
您是否要从该行中提取单词“pagename”?请显示您想要的输出示例。
-
您要提取的究竟是什么?
-
好吧,我尝试获取“pagename”,是的。但是文档很大,有很多链接。所以限制器应该在
<a class="timetable work" href="http://www.test.com/和?tag=meta376">Test</a>之间 -
正确的方法是解析 HTML。在 Perl、Python、Ruby 或其他脚本语言中使用 HTML 解析器。通过其标签/类名获取元素。获取 href 属性。解析 URL 并提取路径。