【发布时间】:2021-09-11 02:14:06
【问题描述】:
我正在尝试使用 python 从网站下载 >100 个 pdf。但是,这些 pdf 文件隐藏在选择选项下。例如:
- 选项 1
- 选项 2
- 选项 3 ...
那么,如果我选择选项 1,我会说谎:
- 选项 1
- 信息 1 的可点击链接 [文件 1 的可点击链接]
- 信息 2 的可点击链接 [文件 2 的可点击链接]
- 信息 3 的可点击链接 [文件 3 的可点击链接]
- 信息 4 的可点击链接 [文件 4 的可点击链接] ...
- 选项 2
- 选项 3
一旦我按下,例如,“文件 1 的可点击链接”,图片就会弹出,在弹出窗口的右上角有一个“查看 PDF”选项。现在如何为选项 1 下的每个文件循环下载 PDF?我是网络抓取的新手,非常感谢您的帮助。
谢谢!
【问题讨论】:
-
可以分享网址吗?
-
此页面上的 PDF 文件在哪里?
-
按[地图]。弹出窗口将出现。然后,在弹出窗口的右上角有一个PDF选项。
-
我尝试研究已经回答的类似问题,但考虑到我的网站格式具有多个下拉选项,它们似乎不是网络抓取 pdf。此外,一旦您按下查看 PDF,它将带您到另一个链接,该链接将包含实际的 PDF 链接。这是感兴趣的链接。
标签: python web-scraping pdf-scraping