【发布时间】:2019-02-26 07:38:16
【问题描述】:
我发现这个网站有一些我想分析的有趣数据。但是该页面真的很慢并且围绕 .docx 文件构建。但它具有 HTML 中每个文档的预览
http://www.produktresume.dk/AppBuilder/search?page=0
我目前的策略想法是:
- 等待页面加载(之前没试过)
- 深入了解
div class="widget_inside" - 获取
<a class="preview_link"中的所有href - 遍历所有收集到的链接并将 HTML 解析成一些
.json/.csv供以后分析
在抓取方面我还是个新手,之前在 Python 中使用 BeautifulSoup 时遇到了一些运气——页面没有加载。但是我最近一直在使用 nodejs,所以希望能够在带有一些 npm 包的 JS 中做到这一点。
谁能帮我找到适合这项工作的工具和一些关于最佳策略的指针/cmets?
奖金信息
通过解码左侧的过滤器链接之一:
http://www.produktresume.dk/AppBuilder/search?expand_all=true&page=0&refinements_token={}&selected_tokens[]={"s":[{"id":"folder-refinement","xPath":"$folders","separator":"\u003e","logic":"OR","s":[{"n":"Human","k":"Human"}]}]}
不知道有没有用?
【问题讨论】:
-
似乎有 7580 个结果,您想要所有这些链接吗?
-
@G_M 是的,请。
标签: javascript python web-scraping ecmascript-6