【问题标题】:Will web scraping only cause harm to those who have a website? [closed]网络抓取只会对拥有网站的人造成伤害吗? [关闭]
【发布时间】:2018-12-27 08:17:52
【问题描述】:

今天我使用 beautifulsoup4 抓取了一个网站,并尝试在该网站上获取大约 16.000 条数据。 就在那之后的几分钟,那个网站就宕机了,大约几个小时就无法访问了。 所以..我的问题是:

网页抓取只会对拥有网站的人造成伤害吗?

【问题讨论】:

  • 想象网站所有者是你,你的感受如何?
  • 与 DDoS @ewwink.. 的效果一样吗?
  • 如果你做得太快,是的,几乎一样。
  • 基于意见的问题不属于这里。但是考虑一下,谷歌在抓取网站时会伤害它们吗?如果它遵循 robots.txt 则不是

标签: web-scraping server beautifulsoup scrapy scrape


【解决方案1】:

首先,建议先检查每个站点的 robots.txt 文件,然后再像刚才那样使用自动请求轰炸它。这对网站所有者和您都不利。要抓取网站,请在开始编写网络抓取工具之前按照以下步骤操作:

  1. 检查网站是否已经有可用的 API 来简化您的任务。如果没有,请转到第 2 步。
  2. 查看 robots.txt 文件,该文件位于 www.anywebsite.com/robots.txt。如果所有者列出了此页面(在大多数情况下他会列出),您可以查看是否允许机器人访问该网站。如果是,请检查哪些页面是不允许的,并检查是否有任何速率限制。
  3. 如果 robots.txt 文件不存在,请确保您足够温和,不要以子弹速度向网站发送请求。它可能会对所有者造成伤害,并且您可能永远无法访问该网站。

【讨论】:

    猜你喜欢
    • 2014-12-28
    • 1970-01-01
    • 2015-03-16
    • 1970-01-01
    • 2011-02-23
    • 1970-01-01
    • 1970-01-01
    • 2016-07-05
    • 1970-01-01
    相关资源
    最近更新 更多