【发布时间】:2018-12-23 19:03:39
【问题描述】:
在使用 parquet 存储用户列表的 Spark 应用程序中。每个用户都有一个电话号码。
我需要通过电话进行高效搜索,最好是通过电话进行分区。文档说一个密钥应该有超过 10 000 的价值,在我的情况下这可能是数百万。
是否还有任何方法/或任何技巧/或某些最先进的按电话号码进行分区?例如对电话号码进行哈希处理或仅按第一个数字进行分区?
谢谢
【问题讨论】:
标签: apache-spark optimization parquet partition