【问题标题】:Web Crawler - Ignore Robots.txt file?网络爬虫 - 忽略 Robots.txt 文件?
【发布时间】:2012-01-13 06:17:41
【问题描述】:

有些服务器有一个 robots.txt 文件,以阻止网络爬虫抓取他们的网站。有没有办法让网络爬虫忽略 robots.txt 文件?我正在为 python 使用机械化。

【问题讨论】:

  • 如果你这样做,大概有法律问题
  • 否决这个是不好的,因为这是一个合法的问题。然而,这是一个坏主意。
  • 虽然我同意忽略 robots.txt 是个坏主意,但您认为法律问题是什么?

标签: python web-crawler mechanize robots.txt


【解决方案1】:

mechanize 的documentation 有这个示例代码:

br = mechanize.Browser()
....
# Ignore robots.txt.  Do not do this without thought and consideration.
br.set_handle_robots(False)

这正是你想要的。

【讨论】:

  • 我建议再次在 meta 上的 flagging this question 上提出您的问题。对于如何处理涉嫌侵犯版权的行为似乎存在不同的意见,而一个明确的答案会有所帮助。
  • @NullUser 可以。我会尝试将我得到的所有相互矛盾的建议集中在一个地方,看看我们是否不能达成一个共同的观点!
【解决方案2】:

This 看起来像你需要的:

from mechanize import Browser
br = Browser()

# Ignore robots.txt
br.set_handle_robots( False )

但你知道你在做什么......

【讨论】:

    猜你喜欢
    • 2011-10-17
    • 1970-01-01
    • 1970-01-01
    • 2011-02-04
    • 1970-01-01
    • 1970-01-01
    • 2011-12-11
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多