【发布时间】:2015-03-11 15:46:15
【问题描述】:
我需要匹配部分字符串,同时忽略 HTML 标记。这意味着如果用户想在源代码中查找字符串“foo and foo1”。
Two strings, <u>foo</u> and foo1
因为标签,他不会得到匹配。
我试过正则表达式,但是由于标签 can 和 don't have to be 在那里,它似乎太复杂了。
它不是服务器端脚本。这将是一个从控制台运行的应用程序。
更具体地说: 用于语法高亮。所以用户希望“foo and foo1”是斜体,但它的一部分已经下划线并且无论如何都不会匹配。这就是为什么我不能剥离字符串。
【问题讨论】:
-
您遇到的实际问题是什么?删除所有标签,以便用户可以匹配单词组合?
-
可能是一个 DOM 解析器,例如 DOMDocument
-
@stribizhev 不。未从文件中删除任何内容,但仍能找到字符串
-
@Croolman - 如果不制作去除标签的中间字符串,则无法完成。所以这就是你的答案。
-
@Croolman - 您可以调查 Google 在搜索时是如何进行的,然后选择
cached。显然有办法。可能使用 dom 获取内容,然后插入高亮,然后重构。