【发布时间】:2020-04-21 02:13:14
【问题描述】:
我正在开发一个基本的 python 网络爬虫程序,以进入网站并读取电子邮件地址并将其显示为输出。我得到了正确的答案,但它被重复了。你能帮忙修一下吗?
这是程序:
from re import findall
import urllib.request
url = "https://www.uta.edu/academics/schools-colleges/business/admissions-and-advising/cob-advising"
print("Email addresses for advisors:")
response = urllib.request.urlopen(url)
html = response.read()
htmlStr = html.decode()
pdata = findall(r"[A-Za-z0-9._%+-]+"
r"@[A-Za-z0-9.-]+"
r"\.[A-Za-z]{2,4}", htmlStr)
for item in pdata:
print(item)
【问题讨论】:
标签: python regex web-crawler findall