【发布时间】:2021-06-09 04:02:51
【问题描述】:
当我从 https://www.skechers.com/women/shoes/athletic-sneakers/?start=0&sz=168 抓取时,我的目标是获取所有产品 ID,但它无法打印
import requests
from bs4 import BeautifulSoup
from selenium import webdriver
from selenium.webdriver.common.keys import Keys
import pandas as pd
import time
url = 'https://www.skechers.com/women/shoes/athletic-sneakers/?start=0&sz=168'
driver = webdriver.Chrome('D:/chromedriver')
driver.get(url)
pageSource = driver.page_source
soup = BeautifulSoup(pageSource, 'html.parser')
content= soup.find_all('div',class_='col-6 col-sm-4 col-xl-3 mb-2 mb-md-1 mb-lg-4 px-lg-3')
skechersshoes=[]
for item in content:
pid=item.select_one('div[data-pid="product"]')
print(pid)
skechers={
'productid':pid
}
skechersshoes.append(skechers)
df = pd.DataFrame(skechersshoes)
print(df.head())
df.to_csv('skechers.csv')
【问题讨论】:
-
依赖项太多,我无法为您调试。循环是否执行了预期的次数?项目是否包含预期数据?
-
@Allan Wind 已更新并用红色标记突出显示
-
它显示 data-pid 是一个数字,但您搜索 data-pid="product"
标签: python selenium beautifulsoup python-requests webdriver