【问题标题】:Extracting HTML tags Beautifulsoup提取 HTML 标签 Beautifulsoup
【发布时间】:2021-12-05 02:23:47
【问题描述】:

我试图弄清楚如何从以下文章 HTML 属性中提取唯一的标题:

<a href="/wiki/Jammu_and_Kashmir_(union_territory)" title="Jammu and Kashmir (union territory)">Jammu and Kashmir< /a>

目前我可以使用以下方法提取所有整篇文章标签:

print(soup.find_all('a'))

但是如何只提取属性中的标题呢?

【问题讨论】:

  • 页面上还有其他 HTML 吗?或者只有那个sn-p
  • 页面上有更多 HTML,但结构相同,我只需要标题。

标签: beautifulsoup


【解决方案1】:

要访问标题,请使用:

print(soup.find('a')['title'])

只有当页面上有一个a 时,这才有效。否则,通过它的文本找到标签:

print(soup.find(lambda t: t.name == 'a' and 'Jammu and Kashmir' in t.text)['title'])

编辑

获取所有个标题:

for tag in soup.find_all(lambda t: t.name == 'a' and 'title' in t.attrs):
    print(tag['title'])

【讨论】:

  • 这样可以提高标题谢谢!如果有更多标题,我将如何调整以提取它们?
  • @CodyChristensen 查看我的编辑
猜你喜欢
  • 1970-01-01
  • 2020-01-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-04-29
  • 2018-03-16
  • 2018-09-06
  • 1970-01-01
相关资源
最近更新 更多