【发布时间】:2018-11-30 00:01:13
【问题描述】:
如果 URL 与特定域匹配,我如何从链接 HTML 元素中提取文本?
例如从以下位置提取hello:
<a href="https://example.com/2018/11/22/ff/">hello</a>
如果 URL 不是 example.com,那么它应该忽略它。
我正在使用正则表达式 </?a(|\s+[^>]+)>,但它适用于所有域,而它应该只适用于 example.com。
【问题讨论】:
-
Don't use r̩̟̳̺͙͜e̩̮̲͓͕g̳̩͎̳ḙ̙x̀ to parse HTML,使用DomDocument。也不要使用正则表达式来解析 URL,使用
parse_url()。 -
我正在使用 wordpress 上的插件来执行正则表达式,所以对正则表达式很紧:)
-
使用
/<a\shref=\"https?:\/\/example.com[^"]+\">([^<]+)<\/a>/regex101.com/r/VAUDQW/1
标签: javascript php html regex