【发布时间】:2020-06-24 17:15:06
【问题描述】:
我正在开发一个内置于 RSelenium 的刮刀。使用 Python 可以更轻松地完成许多任务,因此我设置了一个可以访问 R 和 Python 代码块的 .Rmd 文件。
爬虫的R端在Chrome中打开一个网站,登录,访问和爬取登录墙后面的各个页面。 (这是在网站所有者的许可下完成的,他们宁愿用户自己抓取数据,也不愿将数据放在一起下载。)
我还需要从这些页面下载文件,这是我在 RSelenium 中不断尝试但反复回到 Python 解决方案的任务。
我不想花时间用 Python 重写代码,因为它相当健壮,但是我尝试使用 Python 导致打开一个新驱动程序,这会启动一个不再登录的新会话。是否有让 Python 代码块访问由 RSelenium 驱动的现有驱动程序/会话的方法?
(如果此解决方案不成功,我将针对我的 RSelenium 下载问题单独提出一个问题。)
【问题讨论】:
-
据我所知,这不受支持。而且 selenium 不支持与已经打开的浏览器交互。
-
@Jortega 考虑将评论转换为答案,以便 OP 接受它以得出合乎逻辑的结论。
标签: python r selenium web-scraping selenium-chromedriver