【发布时间】:2018-04-12 13:39:13
【问题描述】:
我在 Spark 2.2.0 上,在 EMR 上运行。
我有一个大数据框 df(压缩后的 snappy 文件中大约 40G),它由键 k1 和 k2 分区。
当我通过k1 === v1 或 (k1 === v1 && k2 ===v2`) 查询时,我可以看到它只是查询分区中的文件(大约 2 % 的文件)。
但是,如果我 cache 或 persist df,突然这些查询会触及 所有 分区,要么炸毁内存,要么太多性能较差。
这是一个很大的惊喜 - 有没有办法进行缓存来保留分区信息
【问题讨论】:
-
你能展示一些示例代码吗?
标签: apache-spark