【问题标题】:BeautifulSoup extract top-level tags only [duplicate]BeautifulSoup 仅提取顶级标签[重复]
【发布时间】:2016-10-21 00:42:34
【问题描述】:

我正在 Python 3.4 中使用 BeautifulSoup 进行网络抓取。

现在我在学习过程中遇到了一个问题: 我正在尝试从网页获取表格行,我正在使用 find_all() 来获取它们,但是在表格内部 - 有更多表格,其中包含表格行!如何获取 BeautifulSoup 中标签的顶级/第一级一般或特定元素?

# Retrieves all the row ('tr') tags in table
my_table.find_all('tr')

顺便说一句,这个问题是这个问题的重复(只有那里使用的编程语言是PHP):Extract only first level paragraphs from html

【问题讨论】:

    标签: python html python-3.x web-scraping beautifulsoup


    【解决方案1】:

    显然find_all()方法中有一个名为recursive的参数,默认设置为True

    将其设置为 false,使该方法仅返回顶级元素。

    find_all('tr', recursive=False)
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2022-11-10
      • 2021-01-29
      • 2021-12-05
      • 2016-03-12
      • 1970-01-01
      • 2013-04-29
      • 2016-10-29
      • 2018-04-23
      相关资源
      最近更新 更多