【发布时间】:2021-10-04 20:43:10
【问题描述】:
我是第一次尝试网络抓取,我遇到了很多麻烦,尤其是因为我应该使用的网站尽最大努力阻止抓取库。我下载了 HTML 代码,但我要收集以制作 csv 文件的数据不在标签中(如 div、li、...)。它就像@type 显示字典一样。我需要制作一个数据集,其中的列显示字典中的列(评级值、作者、URL 和描述)。我下载的 HTML 源代码附在下面。感谢您的帮助!
这是我用来抓取它的代码:
from bs4 import BeautifulSoup
import requests
import re
import pandas as pd
from selenium import webdriver
import codecs
import os
import numpy as np
import pandas as pd
#import nltk
#import matplotlib.pyplot as plt
#from tensorflow import keras
os.system('cls')
PATH = "C:\\Users\\HCES\\Downloads\\chromedriver.exe"
driver = webdriver.Chrome(PATH)
i=1
driver.get("https://www.zomato.com/beirut/divvy-ashrafieh/reviews?page= {}&sort=dd&filter=reviews-dd".format(i))
page_source = driver.page_source
soup = BeautifulSoup(page_source,"lxml")
【问题讨论】:
标签: python csv web-scraping beautifulsoup data-science