【发布时间】:2021-08-14 13:02:51
【问题描述】:
我是网络抓取的新手,并试图 scape 以下网页:http://www.amis.pk/Arrivalreports/Arrival%20source%20target.aspx
这是我尝试从 Python 网页访问内容的内容。我只是尝试抓取内容,现在,解析将进行。
import requests
from bs4 import BeautifulSoup
r_obj = requests.Session()
url = 'http://www.amis.pk/Arrivalreports/Arrival%20source%20target.aspx'
r_soup = r_obj.get(url)
soup = BeautifulSoup(r_soup.content,'lxml')
hidden_inputs = soup.find_all("input",type="hidden")
data = {
hidden_inputs[0]['name']:hidden_inputs[0]['value'],
hidden_inputs[1]['name']:hidden_inputs[1]['value'],
# hidden_inputs[2]['name']:hidden_inputs[2]['value'],
# hidden_inputs[3]['name']:hidden_inputs[3]['value'],
hidden_inputs[4]['name']:hidden_inputs[4]['value'],
hidden_inputs[5]['name']:hidden_inputs[5]['value'],
'allmarket$ctl00$ctl03$ctl00': 'Tomato, Potato, Onion',
'allmarket$ctl00$ctl05$ctl00': 'Lahore',
'allmarket$ctl00$ctl07$ctl00': '08/13/2021',
'allmarket$ctl00$ctl03$ctl03$ctl01': 'on',
'allmarket$ctl00$ctl03$ctl03$ctl02': 'on',
'allmarket$ctl00$ctl03$ctl03$ctl03': 'on',
'allmarket$ctl00$ctl05$ctl03$ctl01': 'on',
'allmarket$ctl04':'',
'allmarket$ctl05':'',
'allmarket$ctl06': '0',
'allmarket$ctl07': '0',
'allmarket$ctl00$ctl00': 'View Report',
}
url_needed = 'http://www.amis.pk/Arrivalreports/Arrival%20source%20target.aspx'
final = r_obj.post(url_needed,verify=False,data=data)
soup1 = BeautifulSoup(final.content,"lxml")
detail_tab = soup1.find_all("table")
上面的代码运行后,detail_tab 不包含相关的表数据,只包含最上面的表头。我错过了什么?
【问题讨论】:
标签: python asp.net web-scraping beautifulsoup python-requests