【发布时间】:2018-10-26 01:26:32
【问题描述】:
我在从网页上的表格中提取或报废数据方面需要帮助。我用的是漂亮的汤。无法提取具有表号的表。 6. 任何帮助将不胜感激:
需要表 6 中的所有行数据。一个网页中有多个表格,但我只需要合规信息的数据,不知道该怎么做。
网址是here
我的代码如下:
link = ["http://ec.europa.eu/environment/ets/ohaDetails.do?returnURL=&languageCode=en&accountID=®istryCode=&buttonAction=all&action=&account.registryCode=&accountType=&identifierInReg=&accountHolder=&primaryAuthRep=&installationIdentifier=&installationName=&accountStatus=&permitIdentifier=&complianceStatus=&mainActivityType=-1&searchType=oha&resultList.currentPageNumber=1&nextList=Next%C2%A0%3E&selectedPeriods="]
for pagenum, links in enumerate(link[start:end]):
print(links)
r = requests.get(links)
time.sleep(random.randint(2,5))
soup = BeautifulSoup(r.content,"lxml")
tree = html.fromstring(str(soup))
value = []
data_block = soup.find_all("table", {"class": "bordertb"})
print (data_block)
output = []
for item in data_block:
table_data = item.find_all("td", {"class": "tabletitle"})[0].table
value.append([table_data])
print (value)
with open("Exhibit_2_EXP_data.tsv", "wb") as outfile:
outfile = unicodecsv.writer(outfile, delimiter="\t")
outfile.writerow(["Data_Output"])
for item in value:
outfile.writerow(item)
【问题讨论】:
标签: python xpath web-scraping beautifulsoup request