【发布时间】:2019-07-06 23:36:51
【问题描述】:
我正在尝试从页面中获取联系信息。我需要姓名、职位、电话和电子邮件地址。
我正在学习 Python,并尝试根据我知道的数据编写代码。我能够提取包含各个联系人的 div 块,但我不确定一旦拥有它们后如何爬过它们。
tags = soup.find_all('div', attrs={'class':'tshowcase-inner-box'})
但后来我想爬过儿童 div,但没有运气。
fullname = soup.find('div', attrs={'class':'tshowcase-box-title'})
title = soup('div', attrs={'class':'tshowcase-single-position'})
phone = soup('div', attrs={'class':'tshowcase-single-telephone'})
email = soup('div', attrs={'class':'tshowcase-box-social'})
我不确定接下来会发生什么,并感谢任何指点。
这里是示例 HTML:
<div class="tshowcase-inner-box ts-float-left ">
<div class="tshowcase-box-info ts-align-left ">
<div class="tshowcase-box-title">FULL NAME</div>
<div class="tshowcase-box-details">
<div class="tshowcase-single-position"><i class="fa fa-chevron-circle-right"></i>JOB TITLE</div>
<div class="tshowcase-single-telephone"><i class="fa fa-phone-square"></i><a href="tel:PHONE">PHONE</a></div>
</div>
<div class="tshowcase-box-social"><a href="mailto:EMAIL" rel="nofollow" target="_blank"><i class="fa fa-envelope-o fa-lg"></i></a></div>
</div>
</div>
【问题讨论】:
-
是否有与此相关的公共网址?您只想要全名等的第一个匹配项(每页只有一个匹配项吗?)?
标签: python html beautifulsoup