【发布时间】:2017-10-22 13:00:34
【问题描述】:
我只是想知道人们对从 Hive 读取与从 .csv 文件或 .txt 文件或 .ORC 文件或 .parquet 文件读取的想法是什么。假设底层 Hive 表是具有相同文件格式的外部表,您更愿意从 Hive 表中读取还是从底层文件本身读取,为什么?
迈克
【问题讨论】:
-
您可能会发现stackoverflow.com/questions/32373460/… 的最新答案非常有趣>>矢量化是一个真正的好处......以及基于本地统计数据的“谓词下推”,“跳过扫描”(这两个功能都需要列格式)、高效的分区修剪、适当的压缩......
-
问得好大迈克
标签: apache-spark hive spark-dataframe parquet flat-file