【发布时间】:2018-10-23 10:43:18
【问题描述】:
[Spark 新手]
创建 DataFrame 后,我尝试根据 DataFrame 中的列对其进行分区。当我使用 data_frame.rdd.partitioner 检查分区器时,我得到 None 作为输出。
使用->进行分区
data_frame.repartition("column_name")
根据 Spark 文档,默认分区器是 HashPartitioner,我如何确认?
另外,如何更改分区器?
【问题讨论】:
标签: scala apache-spark