【发布时间】:2011-12-18 07:35:10
【问题描述】:
我想在HTML文档中查找©,基本上得到版权归属的实体。
版权行有几种不同的显示方式:
<p class="bg-copy">© 2011 The New York Times Company</p>
或
<a href="http://www.nytimes.com/ref/membercenter/help/copyright.html">
© 2011</a>
<a href="http://www.nytco.com/">The New York Times Company</a>
或
<br>Published since 1996<br>Copyright © CounterPunch<br>
All rights reserved.<br>
我想忽略日期和中间标签,只获取“The New York Times Company”或“Counterpunch”。
我在 JavaScript 或 JQuery 中使用 regex 的方法并不多,尽管我觉得它可能会导致头疼的问题。如果有更好的方法,请告诉我。
【问题讨论】:
-
不要使用正则表达式,而是使用 DOM 树来查找您要查找的内容。一些链接:howtocreate.co.uk/tutorials/javascript/dombasics
-
通常你会得到的响应是——请不要使用正则表达式进行 JS 解析。使用 JS 解析器。问题是 - 你可以吗?
-
@ZenMaster Regex 不是这种解析的工具。
标签: javascript jquery regex html-parsing text-extraction