【问题标题】:ESPN.com Python web scraping issueESPN.com Python 网页抓取问题
【发布时间】:2017-11-23 03:19:11
【问题描述】:

我正在尝试为所有大学橄榄球队的花名册提取数据,因为我想根据他们花名册的组成对球队的表现进行一些分析。

我的脚本在第一页上运行,它遍历每个团队并可以打开每个团队的名册链接,但是我在一个团队的名册页面上运行的 Beautiful Soup 命令不断抛出索引错误。当我查看 HTML 时,似乎我正在编写的命令应该可以工作,但当我从 Beautiful Soup 打印页面源时,我看不到我在 Chrome 的开发人员工具中看到的内容。这是一些用于提供内容的 JS 实例吗?如果是这样,我认为 Selenium 解决了这个问题?

我的代码...

import requests
import csv
from bs4 import BeautifulSoup
from selenium import webdriver

teams_driver = webdriver.Firefox()
teams_driver.get("http://www.espn.com/college-football/teams")
teams_html = teams_driver.page_source
teams_soup = BeautifulSoup(teams_html, "html5lib")

i = 0

for link_html in teams_soup.find_all('a'):
    if link_html.text == 'Roster':
        roster_link = 'https://www.espn.com' + link_html['href']

        roster_driver = webdriver.Firefox()
        roster_driver.get(roster_link)
        roster_html = teams_driver.page_source
        roster_soup = BeautifulSoup(roster_html, "html5lib")

        team_name_html = roster_soup.find_all('a', class_='sub-brand-title')[0]
        team_name = team_name_html.find_all('b')[0].text

        for player_html in roster_soup.find_all('tr', class_='oddrow'):
            player_name = player_html.find_all('a')[0].text
            player_pos = player_html.find_all('td')[2].text
            player_height = player_html.find_all('td')[3].text
            player_weight = player_html.find_all('td')[4].text
            player_year = player_html.find_all('td')[5].text
            player_hometown = player_html.find_all('td')[6].text

            print(team_name)
            print('\t', player_name)

        roster_driver.close()

teams_driver.close()

【问题讨论】:

    标签: python selenium web-scraping beautifulsoup


    【解决方案1】:

    在您的 for 循环中,您使用的是第一页 (roster_html = teams_driver.page_source) 的 html,因此当您尝试选择 team_name_html 的第一项时会出现索引错误,因为 find_all 返回一个空列表。

    另外,您不需要打开所有Firefox 的实例,您可以在拥有 html 时关闭驱动程序。

    teams_driver = webdriver.Firefox()
    teams_driver.get("http://www.espn.com/college-football/teams")
    teams_html = teams_driver.page_source
    teams_driver.quit()
    

    但你不必为这个任务使用selenium,你可以使用requestsbs4获取所有数据。

    import requests
    from bs4 import BeautifulSoup
    
    r = requests.get("http://www.espn.com/college-football/teams")
    teams_soup = BeautifulSoup(r.text, "html5lib")
    
    for link_html in teams_soup.find_all('a'):
        if link_html.text == 'Roster':
            roster_link = 'https://www.espn.com' + link_html['href']
            r = requests.get(roster_link)
            roster_soup = BeautifulSoup(r.text, "html5lib")
    
            team_name = roster_soup.find('a', class_='sub-brand-title').find('b').text
            for player_html in roster_soup.find_all('tr', class_='oddrow'):
                player_name = player_html.find_all('a')[0].text
                player_pos = player_html.find_all('td')[2].text
                player_height = player_html.find_all('td')[3].text
                player_weight = player_html.find_all('td')[4].text
                player_year = player_html.find_all('td')[5].text
                player_hometown = player_html.find_all('td')[6].text
                print(team_name, player_name, player_pos, player_height, player_weight, player_year, player_hometown)
    

    【讨论】:

    • 哇...复制和粘贴注定了我。我已经看了几个晚上,甚至“重构”了代码以尝试从不同的站点获取。这根本不是网站。谢谢。
    • 这发生在任何人身上。有时它就在你面前,但你看不见。
    猜你喜欢
    • 2016-02-05
    • 2021-10-07
    • 2023-01-07
    • 2021-05-08
    • 2020-07-03
    • 2016-03-14
    相关资源
    最近更新 更多