【问题标题】:Web crawling and its limitations网络爬取及其局限性
【发布时间】:2010-10-28 19:06:36
【问题描述】:

假设我们在网络上放置了一个文件,如果您知道直接 URL,该文件可以公开评估。没有指向该文件的链接,并且服务器上的目录列表也已禁用。因此,虽然它可以公开访问,但除了输入该文件的确切 URL 外,无法访问该页面。任何类型的网络爬虫(好的或恶意的)能够通过爬取然后索引文件来定位该文件的机会有多大。

对我来说,即使它可以公开访问,也需要运气或查找文件的特定知识。就像把金子埋在后院,让别人在没有地图的情况下找到它,或者知道那里埋着什么东西。

我只是看不到它会被发现的任何其他方式,但这就是我询问 stackoverflow 社区的原因。

谢谢。

【问题讨论】:

    标签: web-crawler


    【解决方案1】:

    过去,据称此类隐藏位置是使用所有者/上传者使用的 Google 工具栏(可能还有其他此类浏览器插件)“找到”的。

    【讨论】:

    【解决方案2】:

    默默无闻的安全永远不会奏效。你说,不会链接到它,我相信你。但是没有什么能阻止您的用户有意或无意地链接到它。正如 ceejayoz 所说,现在有很多不同的地方可以发布链接。甚至还有一些“书签同步器”,人们可能认为它们是私有的,但实际上是对世界开放的。

    所以使用真正的身份验证。不然你以后会后悔的。

    【讨论】:

    • 不能不同意你的观点,除了对服务器具有管理员权限的人之外,没有人知道这个文件的位置。有人只是对文件可公开访问感到害怕,我理解这里存在担忧,但此人对此事的严重性以及有人会发现该文件的实际可能性也是不合理且不太理性的。跨度>
    • 谷歌工具栏和类似工具的存在几乎可以肯定有人会注意到您的“晦涩”网址
    • 如果只有管理员可以访问,你不能把它放在一个只有 localhost 的 HTTP 虚拟主机上,然后让他们 ssh 进入,然后使用本地浏览器吗?
    【解决方案3】:

    链接可以出现在任何地方 - 有人可以在 Twitter 上发布链接,或者在 Facebook 上发布链接,或者在博客上发表评论。只需要一个。

    如果重要的是它不会出现在任何地方,请将其放在密码后面。

    如果它不是很重要,但您仍然希望它不能通过搜索引擎轻松访问,请使用 robots.txt 文件来阻止行为良好的爬虫。

    【讨论】:

    • robots.txt 不会将 URL 指示给行为不端的爬虫,否则他们永远不会找到它?
    • 是的,这就是为什么我说“如果它不重要”。不良爬虫(通常)不会为面向公众的搜索引擎提供服务,因此如果搜索引擎索引是主要问题,robots.txt 是一种可接受的方法。
    • 只需要一个糟糕的爬虫发布一个链接,然后一个“好的”爬虫就可以收获它!
    【解决方案4】:

    购买/出售的点击流数据可能会导致未链接的内容发现:http://en.wikipedia.org/wiki/Clickstream

    【讨论】:

      【解决方案5】:

      假设:

      • 目录列表:禁用。没有人
      • 知道页面的存在。
      • 您的文件不包含任何链接(您的浏览器可能会将引荐来源网址发送到链接的网站)
      • 您已正确设置 robots.txt
      • 您相信所有人都不会将您的链接传播给其他任何人。
      • 你很幸运

      那么,您的页面可能不会被发现或被发现。

      结论?

      使用 .htaccess 文件保护您的数据。

      【讨论】:

      • 即使用户不打算这样做,他们也很有可能会不小心传播链接。
      • 谢谢,是的,关于 .htaccess 的一个好点。除了拥有服务器管理员权限的人之外,没有人知道该文件,因此就页面地址而言,它是特权和机密信息。
      【解决方案6】:

      你是对的。网络爬虫比喻为蜘蛛——它们需要有一种方法来遍历网络(超链接)并到达您的页面。

      要将您的假设页面放入搜索引擎的结果中,您必须手动将其 URL 提交给搜索引擎。有多种服务可将您的页面提交给这些搜索引擎。请参阅“向搜索引擎提交 URL”

      此外,只有当搜索引擎确定您的网页在搜索引擎的专有排名系统中具有足够的元数据/业力时,您的网页才会出现。请参阅“SEO”和“元关键字”。

      【讨论】:

      • 您不必手动提交 URL 以使其显示在结果中。如果您单击页面上的链接到显示最近引荐来源的另一台服务器,Google 可以获取该链接。如果朋友将链接发布到 Twitter,Google 可以获取。
      【解决方案7】:

      是的,没错,网络爬虫访问 URL,它会识别页面中的所有超链接,并将它们添加到要访问的 URL 列表中,并称为爬虫边界,但这些超链接和 URL 具有错误链接。一旦用户单击错误链接并登陆恶意软件站点,他们通常会通过虚假的编解码器安装对话框得到提升。如果这没有得到他们,该网站仍然会加载数十种其他策略来感染他们的计算机。从假工具栏、恐吓软件、流氓软件等等,这些网站应有尽有。他们遇到的一个站点甚至尝试安装 25 种不同的恶意软件。此类网站使人们容易受到安装垃圾邮件机器人、rootkit、密码 Steelers 和各种特洛伊木马等的攻击。

      【讨论】:

        【解决方案8】:

        您可以使用谷歌搜索 api。 对于与任何其他网页未链接的网页。我们不知道。

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 2018-10-12
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2016-10-28
          • 1970-01-01
          • 2017-11-14
          相关资源
          最近更新 更多