【发布时间】:2019-12-04 04:37:00
【问题描述】:
我目前正在处理一堆 CSV 文件并将它们转换为 Parquet。我将这些与 Hive 一起使用并直接查询文件。我想切换到 Dask 进行数据处理。我正在阅读的数据具有可选列,其中一些是布尔类型。我知道 Pandas 目前不支持可选的 bool 类型,但是无论如何要指定 FastParquet 或 PyArrow 我希望字段是什么类型?我对我的 DF 中的 float64 数据很好,但由于现有文件已经是可选的布尔类型,因此不能在我的 Parquet 存储中使用它。
【问题讨论】:
标签: pandas dask pyarrow fastparquet