【发布时间】:2017-11-23 03:19:11
【问题描述】:
我正在尝试为所有大学橄榄球队的花名册提取数据,因为我想根据他们花名册的组成对球队的表现进行一些分析。
我的脚本在第一页上运行,它遍历每个团队并可以打开每个团队的名册链接,但是我在一个团队的名册页面上运行的 Beautiful Soup 命令不断抛出索引错误。当我查看 HTML 时,似乎我正在编写的命令应该可以工作,但当我从 Beautiful Soup 打印页面源时,我看不到我在 Chrome 的开发人员工具中看到的内容。这是一些用于提供内容的 JS 实例吗?如果是这样,我认为 Selenium 解决了这个问题?
我的代码...
import requests
import csv
from bs4 import BeautifulSoup
from selenium import webdriver
teams_driver = webdriver.Firefox()
teams_driver.get("http://www.espn.com/college-football/teams")
teams_html = teams_driver.page_source
teams_soup = BeautifulSoup(teams_html, "html5lib")
i = 0
for link_html in teams_soup.find_all('a'):
if link_html.text == 'Roster':
roster_link = 'https://www.espn.com' + link_html['href']
roster_driver = webdriver.Firefox()
roster_driver.get(roster_link)
roster_html = teams_driver.page_source
roster_soup = BeautifulSoup(roster_html, "html5lib")
team_name_html = roster_soup.find_all('a', class_='sub-brand-title')[0]
team_name = team_name_html.find_all('b')[0].text
for player_html in roster_soup.find_all('tr', class_='oddrow'):
player_name = player_html.find_all('a')[0].text
player_pos = player_html.find_all('td')[2].text
player_height = player_html.find_all('td')[3].text
player_weight = player_html.find_all('td')[4].text
player_year = player_html.find_all('td')[5].text
player_hometown = player_html.find_all('td')[6].text
print(team_name)
print('\t', player_name)
roster_driver.close()
teams_driver.close()
【问题讨论】:
标签: python selenium web-scraping beautifulsoup