【发布时间】:2020-12-11 09:43:16
【问题描述】:
我正在尝试从 IMDB 电影评分前 250 名的 Google 数据中获取数据。
movie_list = top_250_imdb["Title"]
base_url = 'https://www.google.com/search?q='
streaming = []
title = []
price = []
for movie in movie_list:
query_url = (f'{base_url}{movie}')
browser.visit(query_url)
time.sleep(5)
soup = bs(browser.html, 'lxml')
results1 = soup.find_all('div', class_ = 'ellip bclEt')
for result in results1:
streaming.append(result.text)
title.append(movie.capitalize())
results2 = soup.find_all('div', class_ = 'ellip rsj3fb')
for result in results2:
price.append(result.text)
抓取后,我得到了len(streaming) 和len(title) = 1297
但是len(price) = 1296
我无法创建 DataFrame,因为它们的长度不同。
出了什么问题,我该如何解决?
【问题讨论】:
-
Google 搜索结果页上的
streaming和price是什么?
标签: python pandas web-scraping beautifulsoup splinter