【发布时间】:2018-11-24 22:49:31
【问题描述】:
我正在使用 Python 3.5 中的 Selenium 制作网络爬虫,我遇到的问题是,在爬虫时,它会单击某种文件的链接,例如“.pdf”或“.zip”或“.exe” .它打开它们,然后出现“打开方式”对话框,我的程序就卡在那里了。
我已经尝试在链接中查找这些字符串,并且大部分时间它都有效,但我想要 100% 的结果。我该怎么办?
编辑:这是检查良好链接的代码:
def check(link):
li = [".pdf", ".jpg", ".doc", ".docx", ".DOCX", ".xlsx", "xls", ".csv", ".ppt", ".png", ".gif", ".zip", ".tar", ".rar", ".dll", ".ics", ".crl", ".iso", ".txt", ".msi", ".vcs", ".asc", ".exe", ".bmp", ".wmv", ".jpeg"]
for i in li:
if i in link:
return False
if "linkedin.com" in link or "facebook.com" in link or "twitter.com" in link or "instagram.com" in link or "amazon.com" in link:
return False
if "google.com" in link or "?share" in link or "reddit.com" in link:
return False
return True
【问题讨论】:
-
请详细说明您遇到的问题。如果您无法从链接中检测到类型,或许可以尝试读取响应中的 mimetype。
-
你有任何代码试验吗?
-
发布您的代码并更新您的语法
标签: python-3.x selenium selenium-webdriver python-requests web-crawler