【发布时间】:2021-04-15 06:10:35
【问题描述】:
我想将一个非常宽的 Spark Dataframe(>100,000 列)持久保存到 BigTable,该数据框填充稀疏(>99% 的值为空),同时仅保留非空值(以避免存储成本)。
有没有办法在 Spark 中指定在写入时忽略空值?
谢谢!
【问题讨论】:
-
@Igor Dvorzhak:谢谢。我想避免保留空值(在一行或一列中)不排除整个行或列,这是链接所暗示的,并且意味着数据丢失。
-
感谢您的澄清,更新了我的答案。
-
@IgorDvorzhak:谢谢。因此,您建议在每次应用列修剪时将 Spark 数据逐行写入 BigTable 中?没有一些价值修剪的批处理方式? Parquet 的提示是受欢迎的,但在我们讨论 BigTable 时超出了这里的范围;)
-
@IgorDvorzhak:我对您的回答做了一些修改。如果不行,请告诉我。
标签: apache-spark hbase sparse-matrix google-cloud-dataproc google-cloud-bigtable