【问题标题】:Copy multiple links from a website从网站复制多个链接
【发布时间】:2017-06-29 13:26:31
【问题描述】:

我想创建一个随机访问其他网站页面的应用。 本站有四万多页,没有api。

如何收集所有这 40,000 个页面的 url?复制和粘贴将是永恒的。

所有这些页面都遵循相同的结构,类似于 site.com/directory/1.html、site.com/directory/2.html 等

【问题讨论】:

  • @PressingOnAlways 这似乎专门针对wget。 OP 已经用 JavaScript 标记了它。
  • OP 考虑复制和粘贴所有 url,表明他可以对数据进行后处理。我建议使用 wget 或一些已建立的方法来获取 URL 并将其导入您的应用程序。我认为没有必要重新发明网页抓取机器人。

标签: javascript url web


【解决方案1】:

PhantomJS 非常适合这个。 或者你可以学习NodeJS 并设置一个'scraper',它基本上可以通过GET 请求抓取每个页面的html,并使用cheerio(用于服务器端的jquery)之类的东西对其进行解析。

您的问题非常广泛,因为有很多方法可以沉没一艘船。你只需要选择一个工具并开始使用它。祝你好运!

【讨论】:

    【解决方案2】:

    在不同的环境中有多种工具可用于此目的。您可以通过以下方式实现:

    • Node.js - 环境
    • request - http 请求工具
    • cheerio - html 解析工具,支持类似 jQuery 的选择器,如 $("a.somelink-selector")
    • 也许async library 可以更轻松地控制一次要执行的请求数

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-07-26
      • 2015-12-24
      • 2019-01-31
      • 2021-09-13
      • 1970-01-01
      相关资源
      最近更新 更多