从网页上抓取 2 个不同格式的表格 - Beautiful Soup答案

【问题标题】：Scrape 2 different format tables from webpage - Beautiful Soup从网页上抓取 2 个不同格式的表格 - Beautiful Soup
【发布时间】：2018-12-19 10:49:47
【问题描述】：

因此，我的目标是在对许可证代码列表进行迭代后，从网站上抓取 2 个表格（不同格式） - FSC Public Search。我的问题是，因为我想要的两个表 Product Data 和 Certificate Data 有两种不同的格式，所以我必须分别抓取它们。例如网页上的产品数据是普通的"tr"格式，证书数据是"div"格式。

根据我之前提出的问题，我几乎已经解决了我的问题，并且可以在一系列许可证代码中完全检索证书数据（“div”表单）。但是，我无法按我的意愿输出产品数据表。它没有显示 5 个许可证代码的产品数据，而是显示了第一个许可证代码的 5 个副本。我已经尝试将这个抓取放在定义的函数 get_data_by_code 中，但我仍然无法以我想要的格式获取它，它只是 CSV 文件中的一个表。

基本上我不确定在我的函数/脚本中的何处包含此抓取，因此非常感谢您提供任何输入，谢谢。

df3 = pd.DataFrame()
df = pd.read_csv("MS_License_Codes.csv")
codes = df["License Code"]
data = [
        ('code', code),
        ('submit', 'Search'),
        ]
response = requests.post('https://info.fsc.org/certificate.php', data=data)
soup = BeautifulSoup(response.content, 'lxml')



def get_data_by_code(code):
    data = [
        ('code', code),
        ('submit', 'Search'),
    ]

    response = requests.post('https://info.fsc.org/certificate.php', data=data)
    soup = BeautifulSoup(response.content, 'lxml')


 #scraping the certificate data

    status = soup.find_all("label", string="Status")[0].find_next_sibling('div').text
    first_issue_date = soup.find_all("label", string="First Issue Date")[0].find_next_sibling('div').text
    last_issue_date = soup.find_all("label", string="Last Issue Date")[0].find_next_sibling('div').text
    expiry_date = soup.find_all("label", string="Expiry Date")[0].find_next_sibling('div').text
    standard = soup.find_all("label", string="Standard")[0].find_next_sibling('div').text


    return [code, status, first_issue_date, last_issue_date, expiry_date, standard]

# Just insert here output filename and codes to parse...
OUTPUT_FILE_NAME = 'Certificate_Data.csv'

df3 = pd.DataFrame()

with open(OUTPUT_FILE_NAME, 'w') as f:
    writer = csv.writer(f)
    for code in codes:
        print('Getting code# {}'.format(code))
        writer.writerow((get_data_by_code(code)))

##attempting to scrape the product data

        table = soup.find_all('table')[0] 
        df1, = pd.read_html(str(table))
        df3 = df3.append(df1) 

df3.to_csv('Product_Data.csv', index = False, encoding='utf-8')

编辑

所以使用下面的代码，我得到了最后一个许可证代码的产品数据的 5 个副本.. 稍微接近了一点，但我仍然不明白为什么会这样

df3 = pd.DataFrame()
for code in codes:
    print('Getting code# {}'.format(code))
    response = requests.post('https://info.fsc.org/certificate.php', data=data)
    soup = BeautifulSoup(response.content, 'lxml')

    table = soup.find_all('table')[0] 
    df1, = pd.read_html(str(table))
    df3 = df3.append(df1)        

df3.to_csv('Product_Data.csv', index = False, encoding='utf-8')

编辑 2

我一直在使用的示例代码：

codes = ['FSC-C001777', 'FSC-C124838' ,'FSC-C068163','FSC-C101537','FSC-C005776']

格式编辑

这是正确的表格格式，但是如您所见，它是第一个许可证代码中重复 5 次的信息，而不是唯一数据。

这是我想要的格式和信息，这里一切正常：

【问题讨论】：

@MartinEvans 我在下面的编辑 2 中添加了一些。
您给出的代码的预期输出是什么？您能否添加 CSV 文件的外观（文本格式）？
@MartinEvans 我不确定您所说的文本格式是什么意思，所以我添加了当前输出的屏幕截图，因为它们的格式正确，只有其中一个包含错误的信息。
谢谢。首选原始文本而不是屏幕截图。

标签： python html web-scraping beautifulsoup scrapy

【解决方案1】：

对于您提供的codes，这种简化的方法就足够了。它只是直接从 BeautifulSoup 中提取必要的信息，而不需要使用 Pandas 来尝试提取它：

from bs4 import BeautifulSoup
import requests
import csv

fieldnames_cert = ['Code', 'Status', 'First Issue Date', 'Last Issue Date', 'Expiry Date', 'Standard']
fieldnames_prod = ['Code', 'Product Type', 'Trade Name', 'Species', 'Primary Activity', 'Secondary Activity', 'Main Output Category']

codes = ['FSC-C001777', 'FSC-C124838', 'FSC-C068163', 'FSC-C101537', 'FSC-C005776']

with open('Certificate_Data.csv', 'wb') as f_output_cert, \
     open('Product_Data.csv', 'wb') as f_output_prod:

    csv_output_cert = csv.writer(f_output_cert)
    csv_output_cert.writerow(fieldnames_cert)

    csv_output_prod = csv.writer(f_output_prod)
    csv_output_prod.writerow(fieldnames_prod)

    for code in codes:
        print('Getting code# {}'.format(code))
        response = requests.post('https://info.fsc.org/certificate.php', data={'code' : code, 'submit' : 'Search'})
        soup = BeautifulSoup(response.content, 'lxml')

        # Extract the certificate data
        div_cert = soup.find('div', class_='certificatecl')
        csv_output_cert.writerow([code] + [div.text for div in div_cert.find_all('div')])

        # Extract the product data
        table = soup.find('h2', id='products').find_next_sibling('table')

        for tr in table.find_all('tr')[1:]:
            row = [td.get_text(strip=True).encode('utf-8') for td in tr.find_all('td')]
            csv_output_prod.writerow([code] + row)

这将产生 Certificate_Data.csv 包含：

Code,Status,First Issue Date,Last Issue Date,Expiry Date,Standard
FSC-C001777,Valid,2009-04-01,2018-02-16,2019-04-01,FSC-STD-40-004 V3-0
FSC-C124838,Valid,2015-03-23,2015-03-23,2020-03-22,FSC-STD-40-004 V3-0
FSC-C068163,Valid,2010-03-01,2017-08-23,2022-08-22,FSC-STD-40-003 V2-1;FSC-STD-40-004 V3-0
FSC-C101537,Valid,2010-10-01,2013-11-28,2018-11-27,FSC-STD-40-003 V2-1;FSC-STD-40-004 V3-0
FSC-C005776,Valid,2007-07-17,2017-07-17,2022-07-16,FSC-STD-40-004 V3-0

并产生Product_Data.csv 包含：

Code,Product Type,Trade Name,Species,Primary Activity,Secondary Activity,Main Output Category
FSC-C001777,W12 Indoor furnitureW12.4 Beds,,,Secondary Processor,Secondary Processor,FSC Mix
FSC-C124838,"W18 Other manufactured wood productsW18.4 Tools, tool bodies and handles",, Abies spp; Betula spp.; Fagus sylvatica L.; Hevea brasiliensis; Paulownia tomentosa (Thunb. ex Murr) Steud; Picea spp.; Populus spp.; Quercus spp; Schima wallichii (DC.) Korth.; Swietenia macrophylla; Tilia spp.; Ulmus spp.,brokers/traders with physical posession,,FSC Mix;FSC 100%;FSC Recycled
FSC-C068163,P2 Paper,,,brokers/traders with physical posession,Distributor/Wholesaler,FSC Mix;FSC 100%;FSC Recycled
FSC-C068163,P3 Paperboard,,,brokers/traders with physical posession,Distributor/Wholesaler,FSC Mix;FSC 100%;FSC Recycled
FSC-C101537,P8 Printed materials,,,Printing and related service,Secondary Processor,FSC Mix;FSC 100%;FSC Recycled
FSC-C101537,P7 Stationery of paper,,,Printing and related service,Secondary Processor,FSC Mix;FSC 100%;FSC Recycled
FSC-C005776,W12 Indoor furnitureW12.10 Cupboards and chests,"Outros produtos, (baú, quadro espelho, etc.)", Eucalyptus spp; Pinus spp.,Secondary Processor,,FSC Mix
FSC-C005776,W12 Indoor furnitureW12.7 Office furniture,"Produtos para escritório (escrivaninha, mesa, gaveteiros, etc.)", Eucalyptus spp; Pinus elliottii,Secondary Processor,,FSC Mix
FSC-C005776,W12 Indoor furnitureW12.12 Parts of furniture,"Partes de movéis, (peças de reposição)", Eucalyptus spp; Pinus taeda,Secondary Processor,,FSC Mix
FSC-C005776,W12 Indoor furnitureW12.4 Beds,Camas, Eucalyptus spp; Pinus taeda,Secondary Processor,,FSC Mix

【讨论】：

感谢马丁的帮助！但是，我想我可能对我的问题解释得不好。您在上面的答案中概述的表格是我已经成功提取的表格。这是另一个表格（请参阅编辑中的“产品数据”图像），其中包含文本字段中的室内家具、床等数据。循环访问我的许可证代码时，我无法正确提取此表。
抱歉，没有发现您在每页创建两个输出。 Pandas read_html() 有时确实很有用，但是当它失败时，最好滚动你自己的代码来提取你需要的信息。
太棒了，非常感谢！！我不想打扰你，但在最后一个许可证代码之前一切正常（至少对我来说，可能是因为我有 python 2.7）但我收到这个错误：'ascii' codec can't encode character u'\xfa' in position 20 ：序数不在范围内（128）。我尝试在行后添加 .encode('utf-8').strip() 但这导致错误。有没有其他方法可以解决这个问题？
您可以将其添加到列表理解中。此外，如果您使用的是 Python 2.x，则需要更改为使用 'wb' 作为写入模式。我已经更新了脚本。
我自己用这个 sys.setdefaultencoding('utf8') 解决了这个问题！再次感谢您的帮助和反馈，帮助很大。