【发布时间】:2018-05-22 22:30:33
【问题描述】:
我的文本包含许多标签,例如:
<b class="bold"> some bold text </b> main text
<li>list text</li>
<script> script text </script>
我需要删除标签和标签之间的所有文本 在这个例子中,我应该得到“正文”,因为它是唯一没有标签的文本。
我试过了
Regex.Replace(input, "<.*?>", String.Empty);
但它会删除所有标签,而不是它们之间的文本
我试过了
var regEx = new Regex(@"<(.+).*>.*<\/\1>");
var result = regEx.Replace(input, string.Empty);
与
<b class="bold"> bold </b>
main text
<ul>
<li> list </li>
<li> list2 <li>
</ul>
我得到了
main text
<ul>
</ul>
【问题讨论】:
-
到目前为止您尝试过什么?仅供参考:stackoverflow.com/a/1732454
-
将此信息添加到问题本身。使用Edit链接
-
使用 HTML Parser 解析 HTML - What is the best way to parse html in C#?
标签: c# html regex html-parsing