【发布时间】:2019-09-20 22:23:41
【问题描述】:
我正在使用 spark-cassandra-connector。需要从 oracle 表中获取数据。 我有“fiscal_year”和“date_of_creation”列。 目前我已经设置了
.option("lowerBound", 2000);
.option("upperBound",2020);
.option("partitionColumn", "fiscal_year");
//这可行,但会导致数据出现大量偏差。结果火花工作了几个小时。
因此想使用“date_of_creation”列作为分区键,如下所示
.option("lowerBound", "31-MAR-02");
.option("upperBound", "01-MAY-19");
.option("partitionColumn", "date_of_creation");
但它会给出类似“ORA-00932:不一致的数据类型:预期的 DATE 得到 NUMBER”的错误
这里有什么问题? 是否有可能将多个列设置为类似
option("partitionColumn", ["date_of_creation" ,"fiscal_year"]);
对于oracle表中的某些记录,如果“fiscal_year”为null,这种情况下如何编写自定义分区器?
【问题讨论】:
标签: apache-spark apache-spark-sql datastax