【问题标题】:Grabbing a nested title in an anchor tag - web scraping in python在锚标记中抓取嵌套标题 - python 中的网络抓取
【发布时间】:2020-12-10 16:54:45
【问题描述】:

您好,我正在尝试抓取以下页面:

https://www.imdb.com/chart/top

我想获取当您将鼠标悬停在任何电影名称上时显示的所有导演姓名:

这就是我所做的:

direc = requests.get(imdb).content
direc_b = BeautifulSoup(direc, 'lxml')
direc_b_t = direc_b.find_all(class_= "titleColumn")

我得到的结果如下:

<td class="titleColumn">
       1.
       <a href="/title/tt0111161/" title="Frank Darabont (dir.), Tim Robbins, Morgan Freeman">Die Verurteilten</a>
 <span class="secondaryInfo">(1994)</span>
 </td> 

我想抓住的是下面这行,但我不确定接下来应该做什么。:

title="Frank Darabont (dir.), Tim Robbins, Morgan Freeman 

有什么想法吗?

谢谢

【问题讨论】:

标签: python web web-scraping


【解决方案1】:

这应该可以工作

import requests
from bs4 import BeautifulSoup

request = requests.get("https://www.imdb.com/chart/top")
soup = BeautifulSoup(request.content, "html.parser")

for td in soup.findAll('td', {'class': 'titleColumn'}):
    for each in td.findAll('a'):
        director = each.get('title')
        print(director)

【讨论】:

  • 非常感谢!
猜你喜欢
  • 1970-01-01
  • 2014-05-11
  • 2019-07-23
  • 1970-01-01
  • 2020-10-29
  • 1970-01-01
  • 1970-01-01
  • 2021-10-08
  • 1970-01-01
相关资源
最近更新 更多