【发布时间】:2018-11-05 18:45:41
【问题描述】:
我正在使用 Cloud Dataflow 将数据加载到 Cloud SQL 中。一些负载包括对小型数据集的简单转换。我注意到 Cloud Dataflow 需要时间来分配虚拟机来进行处理。有没有办法为云数据流定义一个专用的虚拟机?还是每次运行作业时都必须启动虚拟机?云数据流对小数据集有用还是仅在我们必须处理大数据集时才使用它是可行的?
【问题讨论】:
标签: google-cloud-dataflow dataflow
我正在使用 Cloud Dataflow 将数据加载到 Cloud SQL 中。一些负载包括对小型数据集的简单转换。我注意到 Cloud Dataflow 需要时间来分配虚拟机来进行处理。有没有办法为云数据流定义一个专用的虚拟机?还是每次运行作业时都必须启动虚拟机?云数据流对小数据集有用还是仅在我们必须处理大数据集时才使用它是可行的?
【问题讨论】:
标签: google-cloud-dataflow dataflow
Dataflow 不能使用专用的虚拟机,并且更新管道可能需要完整的设置时间才能开始。从启动一堆流媒体作业开始,我发现它们需要大约 4 分钟才能开始持续从 PubSub 拉取。对于小型数据集,您可能会发现在与您的 SQL 数据库位于同一区域的 GCE 实例上使用本地运行器会更快,在单台机器上。
如果您使用的是小型数据集,并且不打算实际扩展到非常大的数据集,则可以使用 shell 命令来处理数据,比运行 Dataflow 作业更快、更便宜。
A great article about avoiding large data tools when you don't have large data.
【讨论】: