【问题标题】:Remove nested HTML tag inside <p> tags of an EPUB file [closed]删除 EPUB 文件的 <p> 标签内的嵌套 HTML 标签 [关闭]
【发布时间】:2020-08-04 12:02:17
【问题描述】:

我有一个带有标准标题的 html 文件

<!DOCTYPE html PUBLIC "-//W3C//DTD XHTML 1.1//EN" "http://www.w3.org/TR/xhtml11/DTD/xhtml11.dtd">
<html xmlns="http://www.w3.org/1999/xhtml"><head><title></title><link href="../Styles/stylesheet.css" type="text/css" rel="stylesheet" /></head><body><h1>Chapter 17</h1><div class="entry-content_wrap">

还有一些 div 和 p-tags 中的很多普通文本,我的问题是这些标签内是另一个标签,其文本属于句子

<p> Some text bla bla bla <other important text> bla.</p>

而且我有很多文件,我一直在寻找一个正则表达式,它可以删除周围的标签并保留其他任何内容。我正在使用 Sigil,它提供使用正则表达式查找/替换。

我现在有(\&lt;[^p]+\&gt;),它可以匹配&lt;other important text&gt;,但也有很多HTML标头,我不知何故只能捕捉到other important text周围的

【问题讨论】:

    标签: html regex epub


    【解决方案1】:

    如果我正确理解了这个问题,您想删除所有不属于段落标签的尖括号。 在 Javascript 中,我会像这样替换两次:

    'your text'.replace(/<(?!(p>|\/p))/g, '').replace(/(?<!(<p|\/p))>/g, '')
    

    我正在使用负前瞻和负后瞻功能。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2014-10-02
      • 1970-01-01
      • 2013-03-28
      • 2013-10-19
      • 1970-01-01
      • 2011-05-18
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多