【发布时间】:2018-11-28 23:02:15
【问题描述】:
例如,我有一个如下所示的数据集:
dataset
├── a=1
│ └── 1.parquet
├── a=2
│ └── 2.parquet
├── a=3
└── 3.parquet
它被加载为dataset = pyarrow.parquet.ParquetDataset('./dataset')
如何在不将整个数据集读入内存的情况下查询分区“a”的可用条目?谢谢~
【问题讨论】: