【问题标题】:Spark SQL - Hivecontext - Datacopy from one table to another table in HiveSpark SQL - Hivecontext - 从一个表到 Hive 中的另一个表的数据复制
【发布时间】:2017-08-23 09:02:57
【问题描述】:

我正在使用 Spark SQL 代码将数据从一个 Hive 表复制到另一个 Hive 表(外部),数据量为 7400 万行(约 50 GB)。插入操作耗时超过 40 分钟。

hiveContext.sql("insert overwrite table dev_work.WORK_CUSTOMER select * from  dev_warehouse.CUSTOMER")

我尝试过其他数据复制方式,例如:

  1. hdfs -cp 用于这些外部表:

hdfs dfs -cp hdfs:/home/dummy/dev_dwh/CUSTOMER hdfs:/home/dummy/dev_work/WORK_CUSTOMER

  1. 导出导入:
export table dev_warehouse.CUSTOMER to 'hdfs_exports_location/customer';
import external table dev_work.WORK_CUSTOMER from 'hdfs_exports_location/CUSTOMER';

集群详情:

CDH 5.8 , 19 节点集群

您能否帮助调整性能以找到执行快速数据复制的任何替代方法。

谢谢, 阿文德

【问题讨论】:

    标签: apache-spark hive apache-spark-sql


    【解决方案1】:

    尝试Hadoop DistCp,这是一个用于大型集群间/集群内复制的工具

    http://hadoop.apache.org/docs/r2.7.3/hadoop-distcp/DistCp.html

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-11-03
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2015-01-28
      • 1970-01-01
      相关资源
      最近更新 更多