【问题标题】:load data to Redshift & Bigquery directly from Hadoop/HDFS (local/on premises cluster)直接从 Hadoop/HDFS(本地/本地集群)将数据加载到 Redshift 和 Bigquery
【发布时间】:2014-07-27 22:04:33
【问题描述】:

有没有办法直接从 Hadoop/HDFS(本地/本地集群)将数据加载到 Redshift 和 Bigquery。我需要将 1TB 的数据加载到 Redshift 和 Bigquery。所以寻找有效的方法来做到这一点。

谢谢

【问题讨论】:

    标签: database amazon-web-services google-bigquery google-cloud-sql amazon-redshift


    【解决方案1】:

    您还可以使用支持 Hadoop、Redshift、BigQuery、Google Cloud Storage 和 Amazon S3 的 ETL 工具。

    Talend for Big Data 是一种支持所有这些不同数据源的 ETL 解决方案。

    【讨论】:

      【解决方案2】:

      您可以直接从 Amazon EMR 加载,但如果您使用的是 本地 Hadoop 集群,则必须将数据导出到 S3 并使用 COPY 命令从那里加载到 Redshift:

      Using a COPY command to load data

      【讨论】:

      • 关于 Bigquery 的任何线索?
      • 恐怕我对 Bigquery 没有任何经验,抱歉。
      • 类似答案:将您的数据以 CSV 或 JSON 格式导出到 Google Cloud Storage,然后从那里加载。否则将数据流式传输到 BigQuery,但由于它是 1 TB 的现有数据,我更喜欢通过 GCS。
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2014-05-23
      • 1970-01-01
      • 2014-10-07
      • 1970-01-01
      • 1970-01-01
      • 2018-11-18
      • 1970-01-01
      相关资源
      最近更新 更多