【发布时间】:2021-03-25 16:28:53
【问题描述】:
我在 Spark 工作,但对它还是很陌生。我正在从事一项从某个来源读取数据、进行一些转换并写入 Hive 的工作。
为了写信给 Hive,我正在写 dataframe.write.insertInto(hive_table)
我的问题是 Spark 如何将整个 dataframe 写入 Hive?它会像不同executor上的不同分区并行写入一样并行写入,还是将各个分区的所有数据收集到驱动程序然后尝试一口气插入?
【问题讨论】:
标签: apache-spark hive