【问题标题】:beautifulsoup: Parse Span Titlebeautifulsoup:解析跨度标题
【发布时间】:2014-03-02 00:25:49
【问题描述】:

我正在尝试解析一个 html 页面,我已成功到达 html dom 树的子区域,但我被困在有 span 标签的地方。

示例:我最初解析页面如下:

        user_url = base_url + str(user_id) + "/" + display_name
        user_page = urllib2.urlopen(user_url)
        souping_page = bs(user_page)
        badges = souping_page.body.find('div', attrs={'class': 'badges'})

徽章会给我以下信息:

<span><span title="3 gold badges"><span class="badge1"></span><span class="badgecount">3</span></span><span title="23 silver badges"><span class="badge2"></span><span class="badgecount">23</span></span><span title="43 bronze badges"><span class="badge3"></span><span class="badgecount">43</span></span></span>

但我试图通过遍历 dom 结构来提取 &lt;span title="3 gold badges"&gt; 和所有其他 span title 属性。我怎么能在beautifulsoup中做到这一点。

【问题讨论】:

    标签: python html-parsing beautifulsoup


    【解决方案1】:

    你可以这样做:

    >>> badges.span.span
    <span title="3 gold badges"><span class="badge1"></span><span class="badgecount">3</span></span>
    

    【讨论】:

    • @alKid 看起来好像缺少了 &lt;span title="23 silver badges"&gt;
    猜你喜欢
    • 2021-11-13
    • 2011-11-05
    • 2014-12-10
    • 2010-10-10
    • 1970-01-01
    • 1970-01-01
    • 2022-06-27
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多