【发布时间】:2017-05-20 17:36:41
【问题描述】:
我已经使用 pandas.HDFStore() 通过 pandas 将大约 800 GB 的巨大数据帧存储到 HDF5 中。
import pandas as pd
store = pd.HDFStore('store.h5')
df = pd.Dataframe() # imagine the data being munged into a dataframe
store['df'] = df
我想用 Impala 查询这个。有没有一种直接的方法可以将这些数据解析成 Parquet?或者 Impala 是否允许您直接使用 HDF5? HDF5上的数据还有另一种选择吗?
【问题讨论】:
标签: hadoop hdf5 impala parquet hdfstore