【发布时间】:2013-04-20 13:41:03
【问题描述】:
我正在使用 BeautifulSoup 来解析 html 页面中的一些内容。
我可以从 html 中提取我想要的内容(即包含在由 class myclass 定义的 span 中的文本)。
result = mycontent.find(attrs={'class':'myclass'})
我得到这个结果:
<span class="myclass">Lorem ipsum<br/>dolor sit amet,<br/>consectetur...</span>
如果我尝试使用以下方法提取文本:
result.get_text()
我得到:
Lorem ipsumdolor sit amet,consectetur...
正如您所看到的,当标签 <br> 被删除时,内容之间不再有空格,并且两个单词被连接起来。
我该如何解决这个问题?
【问题讨论】:
-
使用 'contents' ,然后替换
? -
你能把这个放到一个例子中以便我接受答案吗?谢谢
-
现在在 iPhone 上。需要靠近计算机来创建经过测试的代码。我希望其他人同时为你创造榜样。
标签: python beautifulsoup