【发布时间】:2012-05-16 04:39:06
【问题描述】:
我已经看到了很多关于从字符串中删除 HTML 标记的问题,但我仍然不太清楚应该如何处理我的具体情况。
我看到许多帖子建议不要使用正则表达式来处理 HTML,但我怀疑我的情况可能需要明智地规避这条规则。
我正在尝试解析 PDF 文件,并且成功地将示例 PDF 文件中的每一页转换为 UTF-32 文本字符串。当图像出现时,会插入一个 HTML 样式的标签,其中包含图像的名称和位置(保存在其他地方)。
在我的应用程序的一个单独部分中,我需要摆脱这些图像标签。因为我们只处理图像标签,我怀疑可能需要使用正则表达式。
我的问题有两个:
- 我应该使用正则表达式来删除这些标签,还是应该使用 HTML 解析模块,例如 BeautifulSoup?
- 我应该使用哪个正则表达式或 BeautifulSoup 构造?换句话说,我应该如何编码?
为清楚起见,标签的结构为<img src="/path/to/file"/>
谢谢!
【问题讨论】:
-
此文件中是否还有其他 HTML?还是只是纯文本和
<img>标签? -
@senderle 不,除了
标签之外没有 HTML,因此我对使用成熟的 HTML 库犹豫不决。格式是总是我上面描述的那样。
-
我刚刚发布了一个答案,但我想知道,在每张图片的关闭 > 之后实际上是否有一个撇号,或者这是一个错字?
-
@joshcartme 好收获!那确实是一个错字!
-
好吧,我打算更新我在下面发布的答案以处理撇号 =)
标签: python html regex beautifulsoup