【发布时间】:2010-09-03 10:58:21
【问题描述】:
我有一个带有一些链接和邮件 ID 的主页,我需要停止从该网页抓取我的网址和邮件 ID... 我用过 robots.txt,但大多数糟糕的爬虫都不会尊重这一点....
【问题讨论】:
-
robots.txt仅适用于防止可敬的爬虫 - 这是大多数搜索引擎(但即使谷歌也承认将页面访问模拟为人类(忽略机器人,伪造浏览器字符串)。混淆内容(使用 JS 或编码字符可能会有所帮助,保护页面(需要登录,或首先输入验证码)都可能有所帮助。
标签: php scraper spam-prevention