【发布时间】:2017-12-12 21:49:19
【问题描述】:
我现在正在创建一个网络爬虫,我想从 imdb 中抓取用户评论。从原始页面直接获取 10 条评论和评分很容易。 例如http://www.imdb.com/title/tt1392170/reviews 问题是要获得所有评论,我需要按“加载更多”,以便在 url 地址不变的情况下显示更多评论! 所以我不知道如何才能获得 Python3 中的所有评论。我现在使用的是请求,bs4。
我现在的代码:
from urllib.request import urlopen, urlretrieve
from bs4 import BeautifulSoup
url_link='http://www.imdb.com/title/tt0371746/reviews?ref_=tt_urv'
html=urlopen(url_link)
content_bs=BeautifulSoup(html)
for b in content_bs.find_all('div',class_='text'):
print(b)
for rate_score in content_bs.find_all('span',class_='rating-other-user-rating'):
print(rate_score)
【问题讨论】:
-
对不起,如果这听起来很刺耳,但这与 python 无关。另外,如果您希望人们帮助您,请务必附上mcve
-
我现在更新了我的代码。我只是想知道如何让我的网络爬虫变得更好。
标签: python nlp web-crawler python-requests