【发布时间】:2020-02-01 03:13:24
【问题描述】:
我只是想在 hive 中创建一个存储为 parquet 文件的表,然后将保存数据的 csv 文件转换为 parquet 文件,然后将其加载到 hdfs 目录中以插入 values.below是我正在做但无济于事的序列:
首先我在 Hive 中创建了一个表:
CREATE external table if not EXISTS db1.managed_table55 (dummy string)
stored as parquet
location '/hadoop/db1/managed_table55';
然后我使用这个 spark 将 parquet 文件加载到上述 hdfs 位置:
df=spark.read.csv("/user/use_this.csv", header='true')
df.write.save('/hadoop/db1/managed_table55/test.parquet', format="parquet")
这是我转换为 parquet 文件的 use_this.csv 文件中的原始值:
这证明指定位置创建了表的文件夹(managed_table55)和文件(test.parquet):
关于为什么这种情况不断发生的任何想法或建议?我知道可能有一个小调整,但我似乎无法识别它。
【问题讨论】:
标签: apache-spark hadoop hive pyspark impala