【发布时间】:2020-07-13 23:37:05
【问题描述】:
嗨,我在 CSV 文件中有 90 GB 数据,我将此数据加载到一个临时表中,然后使用 select insert 命令从临时表到 orc 表,但是为了将数据转换和加载为 orc 格式,在 spark sql 中需要 4 小时.有什么优化技术可以用来减少这个时间吗?到目前为止,我没有使用任何优化技术,我只是使用 spark sql 并将数据从 csv 文件加载到表(文本格式)然后从这个临时表到兽人表(使用选择插入) 使用 spark 提交:
spark-submit \
--class class-name\
--jar file
或者我可以在 spark submit 中添加任何额外的参数来改进优化。
scala 代码(示例):
All Imports
object demo {
def main(args: Array[String]) {
//sparksession with enabled hivesuppport
var a1=sparksession.sql("load data inpath 'filepath' overwrite into table table_name")
var b1=sparksession.sql("insert into tablename (all_column) select 'ALL_COLUMNS' from source_table")
}
}
【问题讨论】:
标签: scala apache-spark pyspark apache-spark-sql pyspark-sql