【问题标题】:Extract nth tags from HTML after specific tag with beautifulsoup使用 beautifulsoup 从 HTML 中提取特定标签后的第 n 个标签
【发布时间】:2020-02-11 04:07:05
【问题描述】:

使用 beautifulsoup,我有一些这样的 HTML 变量:

<head>....<\head>
<body>
<h2> my title <\h2>
<p> text text text <\p>
<p> text2 text2 <\p>

<h2> my title 2<\h2>
<p> text text text <\p>

我想提取每一个和下一个

标签。

我想得到的例子:

First = " 我的标题

文字文字文字

text2 text2 "

第二个 = " 我的标题

文字文字文字"

知道每个文档中的个数和

标签是可变的。

任何人都可以提出解决此问题的方法或方法吗?

【问题讨论】:

    标签: python python-3.x web-scraping beautifulsoup html-parser


    【解决方案1】:

    这样怎么样

    让页面 =

    <head>....<\head>
    <body>
    <h2> my title <\h2>
    <p> text text text <\p>
    <p> text2 text2 <\p>
    
    <h2> my title <\h2>
    <p> text text text <\p>
    

    parser = '<h2> my title <\h2>'
    a = parser + page.split(parser)
    b = parser + page.split(parser)
    

    【讨论】:

    • 谢谢,但它的可变数量

      有其他 5 个文件有 6 个标题,

      是可变的 ...

    • parser = '

      ' length = page.split(parser) for i in range(length) a = parser + page.split(parser)[i+1]

    猜你喜欢
    • 1970-01-01
    • 2021-12-05
    • 1970-01-01
    • 1970-01-01
    • 2020-01-07
    • 1970-01-01
    • 1970-01-01
    • 2014-11-04
    • 1970-01-01
    相关资源
    最近更新 更多