【发布时间】:2019-12-10 19:52:01
【问题描述】:
面对一种情况,其中数据框区分大小写,并且在将此数据框插入配置单元表时,由于列不明确而引发错误
E.g:daframe_test.columns[ABC, abc]
我们能否在运行时动态处理列中的两个值而不抛出错误
通过设置spark.set.conf("spark.sql.caseSensitive", "true")尝试了一种解决方案
但是,在添加此属性后将此数据帧插入配置单元表时,会引发错误/异常,因为内存开销和堆空间等问题。以及不希望在实时项目中设置此属性
【问题讨论】:
-
我可能错了,但是 Hive 中的列名不应该区分大小写,因为 Hive 不支持它。也许您可以在 hive-site.xml 中更改它,但我对此表示怀疑
标签: apache-spark hadoop hive pyspark bigdata