【发布时间】:2019-02-11 12:28:45
【问题描述】:
我想以 Certificates[h3 tag] 的格式打印 - 然后是它下面的表格 然后是其他文档[h3] - 然后是它下面的表格。 但是使用 bs4,我可以单独找到这些文本值,而不是以某种格式一起找到。 我是bs4的新手。 页面链接是-https://www.zaubacorp.com/documents/KAKDA/U01122MP1985PTC002857 另外,我单独查找它们的代码是
import requests
import urllib.request
from bs4 import BeautifulSoup
def make_soup(url):
thepage = urllib.request.urlopen(url)
soupdata = BeautifulSoup(thepage,"html.parser")
return soupdata
soup=make_soup
("https://www.zaubacorp.com/documents/KAKDA/U01122MP1985PTC002857)
soup.prettify()
divs =soup.findAll("td", {"class" :"tab-tc-2"})
divs
soup.findAll("td")
soup.findAll('h3',{'class':'pull-left'})
date = [i.get_text() for i in soup.findAll('td',{"class" :"tab-tc-1"})]
date
header = [i.get_text() for i in soup.findAll('h3',{'class':'pull-left'})]
header
soup.findAll('h3',{'class':'pull-left'})
import pandas as pd
data=pd.DataFrame({"Date":date,"Certificates":Certi})
data
data
【问题讨论】:
-
我想要的是这个抓取有一个正确的格式 - 标题然后是它下面的表格。
标签: python html web-scraping beautifulsoup tags