【发布时间】:2020-10-02 06:01:46
【问题描述】:
我正在尝试从以下 URL 中提取化学名称(全部大写锁定)。
https://www.legislation.gov.au/Details/F2020L01255
我对附表 4 中列出的化学品感兴趣。
import requests
import re
from requests import get
from bs4 import BeautifulSoup
import pandas as pd
import numpy as np
url = 'https://www.legislation.gov.au/Details/F2020L01255'
headers = {"Accept-Language": "EN-AU, en;q=0.5"}
results = requests.get(url, headers=headers)
soup = BeautifulSoup(results.text, "html.parser")
chemicals = []
chems_div = soup.find_all('div', class_='WordSection7')
我被困在这里了。化学名称用 class='MsoNormal' 的 P 标签和 lang='EN-AU' 的 Span 标签包裹。
【问题讨论】:
-
你只想要化学名称吗?或者如果你得到它的描述就可以了吗?
-
@Sushil,如果包含描述就可以了
-
好的...我会在 5 分钟内为您提供代码。
标签: python web-scraping beautifulsoup