【发布时间】:2020-04-03 22:17:03
【问题描述】:
我想在 Google Cloud 中存储网络爬虫软件 Screaming Frog 的副本。这将在 Compute Engine 实例或 Kubernetes 容器中。
可以使用 linux shell 在我的计算机上本地运行尖叫青蛙爬行:
screamingfrogseospider --crawl https://www.example.com --headless --save-crawl --output-folder /tmp/cli
是否可以在 Google Cloud 中做类似的事情?
理想情况下,我想安排某种 cron 任务,使上述 shell 命令运行,从而爬取网站;将生成的抓取保存到 Google Cloud 存储中的存储桶中。
我该怎么做?
另外,我可以使用 Python 等编程语言在 GCP 中设置和安排 cron 任务吗? 这个想法是让我组织中的人员能够登录到 UI(可能内置于 Flask)并自行安排爬网。然后 Flask 将连接到 Google Cloud 并配置任务。
【问题讨论】:
标签: python google-cloud-platform google-compute-engine