【发布时间】:2015-10-06 00:41:14
【问题描述】:
我在 Google 存储桶中有几百个文件(100,000 个)。文件大小约为 2-10MB。我需要在每个文件上应用一个简单的 python 函数(只是数据转换)。我需要从一个桶中读取 - 并行转换(python 函数) - 并存储在另一个桶中。我正在考虑一个简单的 Hadoop 或 Spark 集群来执行此操作。我以前在单个实例上使用并发线程来执行此操作,但我需要一种更强大的方法。实现这一目标的最佳方法是什么?
【问题讨论】:
标签: python hadoop google-cloud-storage google-compute-engine hadoop-streaming