【发布时间】:2012-02-23 16:24:03
【问题描述】:
我有一个最初在 MS Frontpage 中创建的旧网站,我正在尝试 defrontpagify。我编写了一个 BeautifulSoup 脚本来完成大部分工作。剩下的就是删除空表,例如在其td 标记的any 中没有文本内容或数据的表。
我遇到的问题是,如果至少有一个td 标记不包含数据,即使其他标记不包含数据,我到目前为止所尝试的操作也会删除该表。这会删除整个文档中的所有表格,包括我想要保留的数据。
tags = soup.findAll('table',text=None,recursive=True)
[tag.extract() for tag in tags]
关于如何只删除 none 的 td 标签包含任何数据的表有什么建议吗? (我不在乎它们是否包含img 或空锚标记,只要没有文本即可)。
【问题讨论】:
标签: python parsing html-parsing beautifulsoup