【发布时间】:2011-05-15 07:39:52
【问题描述】:
我有一堆 HTML 正在用 BeautifulSoup 进行解析,除了一个小问题外,它运行良好。我想将输出保存为单行字符串,并将以下内容作为我当前的输出:
<li><span class="plaincharacterwrap break">
Zazzafooky but one two three!
</span></li>
<li><span class="plaincharacterwrap break">
Zazzafooky2
</span></li>
<li><span class="plaincharacterwrap break">
Zazzafooky3
</span></li>
理想情况下我会喜欢
<li><span class="plaincharacterwrap break">Zazzafooky but one two three!</span></li><li><span class="plaincharacterwrap break">Zazzafooky2</span></li>
我想删除很多多余的空格,但不一定可以使用strip() 删除,我也不能公然删除所有空格,因为我需要保留文本。我该怎么做? regex 似乎是一个很常见的问题,但这是唯一的方法吗?
我没有任何<pre> 标记,所以我可以在那里更有力一点。
再次感谢!
【问题讨论】:
-
如何打印输出?
-
您可以做浏览器所做的事情:将所有相邻的空白(在文本中)折叠成单个空格。
标签: python regex html-parsing beautifulsoup