【问题标题】:Unable to get HTML source code Selenium , Python of Zomato website无法获取Zomato网站的HTML源代码Selenium、Python
【发布时间】:2021-07-27 12:45:54
【问题描述】:

我正在尝试抓取 Zomato 网站的评论,但我无法从该网站获取源 HTML 代码。我正在尝试获取评论框,但它返回 null 或“NoneType”。 这是我的代码:

from bs4 import BeautifulSoup
import requests
import re
import pandas as pd
from selenium import webdriver
import codecs
import os
import numpy as np
import pandas as pd
#import nltk
#import matplotlib.pyplot as plt
#from tensorflow import keras
os.system('cls')


PATH = "C:\\Users\\HCES\\Downloads\\chromedriver.exe"
driver = webdriver.Chrome(PATH)
i=1
html = driver.get("https://www.zomato.com/beirut/divvy-ashrafieh/reviews?page= 
{}&sort=dd&filter=reviews-dd".format(i))
driver.quit()
#soup=BeautifulSoup(html,"lxml")
#tag=soup.find_all('div', class_ = 'sc-esoVGF cHxNXn')
#print(atag)
print(html)

【问题讨论】:

  • 您是否尝试过等待它加载,使用 webdriver 等待?这些元素有可能是动态添加的,所以最好等待。

标签: python selenium web-scraping beautifulsoup


【解决方案1】:

你做错了。

你正试图从driver.get()返回,但它应该是

driver.page_source 

见下文:

i=1
driver.get("https://www.zomato.com/beirut/divvy-ashrafieh/reviews?page= {}&sort=dd&filter=reviews-dd".format(i))
page_source = driver.page_source
soup = BeautifulSoup(page_source,"lxml")

【讨论】:

  • 非常感谢!这是我第一次网络抓取,请原谅愚蠢的错误。
猜你喜欢
  • 2015-11-09
  • 2017-01-26
  • 2021-04-27
  • 2015-12-22
  • 2017-12-24
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2019-01-14
相关资源
最近更新 更多