【问题标题】:HTML-Regex ReplacementHTML 正则表达式替换
【发布时间】:2014-10-01 06:18:06
【问题描述】:

我有一个包含 HTML 文本的字符串:

string html = "<html>   \r\n\n<body> \n<h1>Hello World</h1>    \r \n \n</body> </html>"; 

我想清除 HTML 标记之外的文本。所以字符串会如下所示:

string html = "<html><body><h1>Hello World</h1></html>"; 

我也在使用 .NET。是否有任何内置功能可以做到这一点?

【问题讨论】:

标签: html .net regex text


【解决方案1】:
Regex REGEX_TAGS = new Regex(@">/\r?\n|\r/|\s+<", RegexOptions.Compiled);
string html = "<html>   /r/n/n<body> \n<h1>Hello World</h1>    \r \n \n</body> </html>"
html = REGEX_TAGS.Replace(html, "><");

【讨论】:

  • 我有一种“感觉”,Hello World 将变为 HelloWorld... 您不应删除空格或至少将 + 更改为 {2,} 以仅捕获空格对并替换他们用一个空格。
  • 你的感觉不对。正则表达式查找空格,“Hello World”不为空。
  • 同意,但它不会在您之前的答案版本中赶上&gt; Hello world &lt;
  • >
  • 你知道浏览器即使是20个浏览器也不会显示超过1个(` `不是&amp;nbsp;),那我们为什么要保留它们呢?不要误会我的意思,我正在努力改进你对这个问题的回答。
猜你喜欢
  • 1970-01-01
  • 2012-06-18
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2019-01-24
相关资源
最近更新 更多