【问题标题】:How to read in files with .snappy.parquet extension如何读入扩展名为 .snappy.parquet 的文件
【发布时间】:2019-11-30 13:50:23
【问题描述】:

我需要将扩展​​名为 .snappy.parquet 的文件读入我的 Jupyter 笔记本,并将其转换为 pandas 数据帧。

import pyarrow.parquet as pq

filename = "part-00000-tid-2430471264870034304-5b82f32f-de64-40fb-86c0-fb7df2558985-1598426-1-c000.snappy.parquet" 
df = pq.read_table(filename).to_pandas()``` 

The error is: ```ArrowNotImplementedError: lists with structs are not supported```

【问题讨论】:

    标签: pandas parquet snappy


    【解决方案1】:

    截至 2019 年 11 月 30 日,Apache Arrow 不支持 List[Struct[..]] 类型的列(即列表和结构的混合嵌套)。正如另一个答案中提到的,相关问题是https://issues.apache.org/jira/browse/ARROW-1644

    要继续读取此文件,您可以通过向pyarrow.parquet.read_table 提供columns 参数来读取所有受支持类型的列。要找出哪些列具有复杂的嵌套类型,请使用pyarrow.parquet.ParquetFile(filename).schema 查看文件的架构。

    【讨论】:

      猜你喜欢
      • 2014-02-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-03-21
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多