【发布时间】:2017-08-23 09:02:57
【问题描述】:
我正在使用 Spark SQL 代码将数据从一个 Hive 表复制到另一个 Hive 表(外部),数据量为 7400 万行(约 50 GB)。插入操作耗时超过 40 分钟。
hiveContext.sql("insert overwrite table dev_work.WORK_CUSTOMER select * from dev_warehouse.CUSTOMER")
我尝试过其他数据复制方式,例如:
- hdfs -cp 用于这些外部表:
hdfs dfs -cp hdfs:/home/dummy/dev_dwh/CUSTOMER hdfs:/home/dummy/dev_work/WORK_CUSTOMER
- 导出导入:
export table dev_warehouse.CUSTOMER to 'hdfs_exports_location/customer'; import external table dev_work.WORK_CUSTOMER from 'hdfs_exports_location/CUSTOMER';
集群详情:
CDH 5.8 , 19 节点集群
您能否帮助调整性能以找到执行快速数据复制的任何替代方法。
谢谢, 阿文德
【问题讨论】:
标签: apache-spark hive apache-spark-sql