【发布时间】:2012-01-13 06:17:41
【问题描述】:
有些服务器有一个 robots.txt 文件,以阻止网络爬虫抓取他们的网站。有没有办法让网络爬虫忽略 robots.txt 文件?我正在为 python 使用机械化。
【问题讨论】:
-
如果你这样做,大概有法律问题
-
否决这个是不好的,因为这是一个合法的问题。然而,这是一个坏主意。
-
虽然我同意忽略 robots.txt 是个坏主意,但您认为法律问题是什么?
标签: python web-crawler mechanize robots.txt