【发布时间】:2020-10-21 23:47:46
【问题描述】:
我正在尝试从该站点获取尽可能多的数据,包括标题、时间和每次事件。
例如,对于 Aniversary Awards Ceremony,它应该打印标题、8:30,以及在 8:30 发生的事件的名称。
标题后的标签(例如时间)开始重复/更改多次,无法准确拉动。有没有更好的方法来解决这个问题?将所有数据尽可能准确地提取到网站?
谢谢
import requests
from bs4 import BeautifulSoup
import pandas as pd
productlinks=[]
url='https://www.sitcancer.org/2020/program/annual-meeting-schedule-2020'
r=requests.get(url)
soup=BeautifulSoup(r.content,'html.parser')
productlist=soup.find_all('div',class_='HtmlContent')
for section in productlist:
title=section.find('span',style="font-family: helvetica; color: #ef4136;")
if title is not None:
title=title.text
else:
title='No'
print(title)
【问题讨论】:
-
问题是什么?是否有某些特定的东西没有按您认为的那样工作?
-
标题后的标签(如时间)开始重复/更改多次,无法准确拉取。有没有更好的方法来解决这个问题?将所有数据尽可能准确地提取到网站?
标签: python html web-scraping beautifulsoup