【发布时间】:2013-10-22 13:53:53
【问题描述】:
我正在尝试从this website 下载所有文件以进行备份和镜像,但是我不知道如何正确解析 JavaScript 链接。
我需要在命名文件夹中以相同的方式组织所有下载。例如,在第一个文件夹中,我将有一个名为“DAP-1150”的文件夹,其中有一个名为“DAP-1150 A1 FW v1.10”的文件夹,其中包含“DAP1150A1_FW110b04_FOSS.zip”文件,依此类推。文件。我尝试在 Python 中使用 beautifulsoup,但它似乎无法正确处理 ASP 链接。
【问题讨论】:
-
我认为 Selenium 在这方面可能有点矫枉过正。我注意到,一旦您单击了链接,它就会进行 POST 提交(因为不询问用户就无法刷新结果页面)。因此,弄清楚单击链接的作用——它可能会在表单中插入一个值并提交它。您在抓取系统中需要做的就是模拟这一点,使用抓取的链接来计算出您需要的输入。
-
是的,在我看来,scrapy 是要走的路,我需要为下载创建文件夹结构并生成完整的下载列表和路径,我可以排队并在有时更新变化。
-
我尝试了很多方法,但仍然无法正常工作,这个网站看起来很奇怪。我想我需要某种可以正确连接到 jquery 的刮板,但我不知道该怎么做。我可以使用时间线功能跟踪在 chrome 中进行的所有调用,但我不知道您如何将其调整为 scrapy 或类似的东西。
-
不,您根本不需要挂钩到 jQuery 或使用 JavaScript。见my answer here。
-
我想我刚刚在 scrapy 中获得了一个可用的 xpath,使用 chrome 插件“//strong/a”至少提供了所有链接。
标签: javascript python asp.net web-scraping