【发布时间】:2017-08-17 12:55:51
【问题描述】:
我正在尝试从网站上抓取评论,但无法通过 '阅读更多' 选项抓取评论。 在阅读更多内容之前,我只能获取数据。 我正在使用 BeautifulSoup。 任何帮助表示赞赏。
【问题讨论】:
标签: python web-scraping beautifulsoup bs4
我正在尝试从网站上抓取评论,但无法通过 '阅读更多' 选项抓取评论。 在阅读更多内容之前,我只能获取数据。 我正在使用 BeautifulSoup。 任何帮助表示赞赏。
【问题讨论】:
标签: python web-scraping beautifulsoup bs4
您将不得不使用 selenium 提供的单击选项,这将允许您找到阅读更多标签或类并单击它,一旦它出现,您将不得不再次单击它.. 当它不显示时你将不得不废弃你需要的内容,
【讨论】:
这是一个演示,说明如何获取所有评论的全文。运行它并获得结果。执行后稍等片刻。这就是您无需单击任何链接即可完成的方法。
import requests ; from bs4 import BeautifulSoup
soup = BeautifulSoup(requests.get("http://www.mouthshut.com/product-reviews/Lakeside-Chalet-Mumbai-reviews-925017044").text, "html.parser")
for title in soup.select("a[id^=ctl00_ctl00_ContentPlaceHolderFooter_ContentPlaceHolderBody_rptreviews_]"):
items = title.get('href')
if items:
broth = BeautifulSoup(requests.get(items).text, "html.parser")
for item in broth.select("div.user-review p.lnhgt"):
print(item.text)
【讨论】:
@user5444075 和@SIM
div.user-review p.lnhgt
上面的好像已经不存在了。
下面的xpath可以用来获取所有的href。
//a[contains(@id,"lnkTitle")]/@href
使用上面的 href 向服务器发出新请求并获取类 rev-main-content 的文本
【讨论】: