【发布时间】:2018-07-31 13:22:51
【问题描述】:
是否有任何已知的库/方法可以将 ORC 文件转换为 Parquet 文件?否则我正在考虑使用 Spark 将 ORC 导入数据框,然后输出到 parquet 文件中
【问题讨论】:
-
Spark、Hive、Pig、MapReduce、NiFi。是的,这是可以做到的。你想到的方法有什么问题?
标签: hadoop apache-spark parquet orc
是否有任何已知的库/方法可以将 ORC 文件转换为 Parquet 文件?否则我正在考虑使用 Spark 将 ORC 导入数据框,然后输出到 parquet 文件中
【问题讨论】:
标签: hadoop apache-spark parquet orc
您提到使用 Spark 读取 ORC 文件、创建 DataFrame,然后将这些 DF 存储为 Parquet 文件。这是一种完全有效且非常有效的方法!
还取决于您的偏好,也取决于您的用例,您甚至可以使用 Hive 或 Pig[也许您可以在此处加入 Tez 以获得更好的性能] 或 Java MapReduce 甚至 NiFi/StreamSets [取决于您的发行版] .这是一个非常简单的实现,你可以做任何最适合你的事情[或者你最喜欢的任何事情:)]
【讨论】:
这样做的一种方法是:
第 1 步)首先,您需要使用“存储为文本”从 ORC 表创建一个表 第 2 步)其次,您可以从以前的输出创建一个表作为“存储为镶木地板” 第 3 步)之后,您可以删除中间表。
【讨论】: