【问题标题】:How can I speed up the GCP datafusion(datapipeline)? [closed]如何加快 GCP 数据融合(数据管道)? [关闭]
【发布时间】:2020-10-19 06:35:47
【问题描述】:

正在使用 Google Cloud 平台数据融合(选项:dev)将大约 300T 的数据传输到 Big Query。

目前处理大约 16GB 需要 34 分钟。处理6T数据大约需要10天。

datafusion中可以修改哪些设置,以便在数据管道中快速执行ETL操作?

感谢您的阅读。

【问题讨论】:

    标签: google-cloud-platform google-cloud-data-fusion


    【解决方案1】:

    您可以做的是更改计算配置文件设置,该设置指定执行管道的方式和位置。例如,配置文件包括云提供商的类型、要在云提供商上使用的服务(例如 Dataproc)、资源(内存和 CPU)、映像、最小和最大节点数以及其他值。

    详细了解CDAP documentation site 上的个人资料。

    其中一个选项是创建一个新的计算配置文件,该配置文件具有更高的工作内存限制或覆盖工作内存以运行管道:

    1. 点击右上角的System Admin,然后点击Configuration标签
    2. 点击系统计算配置文件
    3. 点击创建新配置文件
    4. 选择 Cloud Dataproc
    5. 将项目 ID 和服务帐户密钥留空
    6. 输入需要的worker节点配置
    7. 点击保存

    创建新的计算配置文件后,通过单击管道详细信息视图中的配置并选择新创建的计算配置文件并单击Save,将计算配置文件附加到管道。

    另外,请查看DataFsuion中的autoscaling选项。

    【讨论】:

    • 这个方法好像不支持Data Fusion的开发版。请问是不是企业功能。
    • 企业版提供。
    • @lnes 我检查了。我有个问题。 Dataproc的Master节点和Worker节点的关系你知道吗?单个管道中VM实例的CPU、内存是否与Worker节点相关?
    • 主节点维护有关分布式文件系统的知识并安排资源分配。工作节点存储实际数据并提供运行作业的处理能力。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-10-18
    • 2023-01-30
    • 2021-07-16
    • 2022-01-23
    • 1970-01-01
    • 2020-12-10
    相关资源
    最近更新 更多