【发布时间】:2020-07-22 14:14:07
【问题描述】:
我正在尝试从该网站的价格表中抓取数据:https://www.letsrecycle.com/prices/textiles/textile-prices-2012/
我无法同时使用 read_html 和 BeautifulSoup 找到表格,这很奇怪,因为我能够在其他类似页面上找到表格(例如 https://www.letsrecycle.com/prices/metals/steel-cans/steel-can-prices-2018/)
我尝试过使用不同的解析器,但这并没有帮助。我的代码的相关部分如下:
import pandas as pd
import html5lib
import requests
from bs4 import BeautifulSoup
import urllib
url = 'http://www.letsrecycle.com/prices/textiles/textiles-prices-2012'
req = Request(url, headers={'User-Agent': 'Mozilla/5.0'})
webpage = urlopen(req).read()
dfs = pd.read_html(webpage)
我还尝试了各种 BeautifulSoup 解析器,例如:
soup = BeautifulSoup(webpage, "html5lib")
table = soup.findAll("table")
table
提前非常感谢
【问题讨论】:
标签: python html web-scraping beautifulsoup