【发布时间】:2019-08-07 16:59:19
【问题描述】:
我正在尝试加载一个文件并将其作为 parquet 文件写入我的 HDFS 路径。但是,每当我运行下面的代码时,都不会插入任何值。
下面是我的代码:
#Import Key functions
from pyspark.sql import SparkSession
spark=SparkSession.builder.appName("Spark_TESTT").config("spark.config.option","yarn-client").getOrCreate()
#Call Database
spark.sql("USE db1")
#Create(or load) Table #1
spark.sql("create external table if not exists mx_test ( c0 string, c1 string, c2 string) COMMENT 'Sample Test' stored as parquet location 'hdfs://hadoop_data/path/mx_test'")
df = spark.read.load("/user/files/sample*.txt", format="text" ,inferSchema="false", header="false", sep=",")
df.write.save('hdfs://hadoop_data/path/mx_test/new.parquet", format="parquet")
当我执行 selct * from 语句时,它会显示以下内容:
关于为什么会发生这种情况的任何想法?
【问题讨论】:
标签: apache-spark hive pyspark hdfs