【问题标题】:Use BeautifulSoup to get delimited contents of a div使用 BeautifulSoup 获取 div 的分隔内容
【发布时间】:2010-06-09 19:04:56
【问题描述】:

我想从 BeautifulSoup 中得到正确分隔的文本,必要时将标签变成空白。问题是换行符被折叠并且像<br/> 这样的标签没有呈现为空白。

<div class="companyInfo">
    <p class="identInfo">
        <acronym title="Standard Industrial Code">
            SIC
        </acronym>
        :
        <a href="/?SIC=3674">
            3674
        </a>
        - SEMICONDUCTORS &amp; RELATED DEVICES
        <br />
        State location: CA
    </p>
</div>

如果我运行 BeautifulSoup(sampleHTML).text 我会得到以下信息:

u'SIC:3674- SEMICONDUCTORS &amp; RELATED DEVICESState location: CA'

我想得到正确处理空格的东西,像这样:

u'SIC : 3674 - SEMICONDUCTORS &amp; RELATED DEVICES State location: CA'

有什么建议吗?谢谢!

【问题讨论】:

标签: python beautifulsoup


【解决方案1】:

您也可以使用 getText() 函数。 getText() 有一个用于分隔符的可选参数。

BeautifulSoup(sampleHTML).getText(' ').strip()

strip() 用于删除任何前导和尾随空格。

【讨论】:

    【解决方案2】:

    我最终使用内容方法从各个节点获取我想要的信息。事实证明,这比使用 text 方法更好,因为它消除了对某些文本解析的需要。

    因此,总而言之,使用内容方法或点击 Jouni 留下的链接并在那里查看答案。

    【讨论】:

      猜你喜欢
      • 2021-04-15
      • 2014-10-26
      • 1970-01-01
      • 1970-01-01
      • 2015-01-05
      • 2021-09-07
      • 1970-01-01
      • 1970-01-01
      • 2021-11-27
      相关资源
      最近更新 更多