【问题标题】:DataFrame having case sensitive and not inserted in hive table区分大小写且未插入配置单元表的 DataFrame
【发布时间】:2019-12-10 19:52:01
【问题描述】:

面对一种情况,其中数据框区分大小写,并且在将此数据框插入配置单元表时,由于列不明确而引发错误

E.g:daframe_test.columns[ABC, abc]

我们能否在运行时动态处理列中的两个值而不抛出错误

通过设置spark.set.conf("spark.sql.caseSensitive", "true")尝试了一种解决方案

但是,在添加此属性后将此数据帧插入配置单元表时,会引发错误/异常,因为内存开销和堆空间等问题。以及不希望在实时项目中设置此属性

【问题讨论】:

  • 我可能错了,但是 Hive 中的列名不应该区分大小写,因为 Hive 不支持它。也许您可以在 hive-site.xml 中更改它,但我对此表示怀疑

标签: apache-spark hadoop hive pyspark bigdata


【解决方案1】:

Hive 不支持区分大小写的列名。您必须重命名列以确保它们符合 Hive 中的命名方案。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2021-10-30
    • 2020-09-07
    • 1970-01-01
    • 2015-08-24
    • 1970-01-01
    • 2017-03-17
    • 2022-06-13
    相关资源
    最近更新 更多