【发布时间】:2014-10-20 10:21:31
【问题描述】:
我想从 RESTful HTTP 端点递归下载 JSON 资源,并将这些资源存储在本地目录结构中,按照包含 HTTP URL 的 JSON 字符串形式的相关资源链接。 Wget 似乎是完成这项工作的一个可能的工具,尽管它的递归下载显然仅限于 HTML 超链接和 CSS url() 引用。
有问题的资源是类似于this one 的Swagger 文档文件,尽管在我的情况下所有URL 都是绝对的。 Swagger 模式相当复杂,但它足以跟随任何看起来像绝对 HTTP(S) URL 的字符串。更好的是遵循“路径”属性中指定的绝对或相对路径。
谁能建议一个通用的递归爬虫来做我想要的,或者一个轻量级的脚本 wget 或类似的方法来实现它?
【问题讨论】:
-
如果有人好奇,我正在尝试这样做以跟踪我们开发中的 API 随时间的变化——在发布之前,我们可以将当前文档与之前的快照进行比较释放。
-
无法建议按照您的要求执行的方法,但对于一般信息,Swagger 2.0 通常是单页声明而不是多页声明(它可以多页(如果需要))所以差异会更容易。
-
@webron - 听起来这将是一个改进!不幸的是,我们的 swagger 文档是半自动生成的(使用 swagger-springmvc),我不认为 Swagger v2.0 输出是一种选择。