【问题标题】:Python - read parquet file without pandasPython - 读取没有熊猫的镶木地板文件
【发布时间】:2018-12-01 22:29:00
【问题描述】:

目前我在Python 3.5, Windows 上使用下面的代码来读取parquet 文件。

import pandas as pd

parquetfilename = 'File1.parquet'
parquetFile = pd.read_parquet(parquetfilename, columns=['column1', 'column2'])  

但是,我不想使用 pandas。如何最好地做到这一点?我在Windows 上同时使用Python 2.7 and 3.6

【问题讨论】:

  • pyarrow.parquet 库怎么样? link 出于好奇,你为什么不想使用 pandas?
  • @user2413548,我已经尝试过了。但我似乎无法在 2.7 和 3.6 上安装镶木地板。
  • 使用 virtualenv 同时支持 2.7 和 3.6
  • @user2413548 这不是问题。

标签: python pandas parquet


【解决方案1】:

您可以为此使用duckdb。它是一个类似于 SQLite 但考虑到 OLAP 的嵌入式 RDBMS。有一个不错的 Python API 和一个用于导入 Parquet 文件的 SQL 函数:

import duckdb

conn = duckdb.connect(":memory:") # or a file name to persist the DB

# Keep in mind this doesn't support partitioned datasets,
# so you can only read one partition at a time
conn.execute("CREATE TABLE mydata AS SELECT * FROM parquet_scan('/path/to/mydata.parquet')")

# Export a query as CSV
conn.execute("COPY (SELECT * FROM mydata WHERE col = 'val') TO 'col_val.csv' WITH (HEADER 1, DELIMITER ',')")

【讨论】:

    猜你喜欢
    • 2022-11-24
    • 2019-05-27
    • 2018-10-14
    • 1970-01-01
    • 2017-04-25
    • 2019-08-04
    • 2022-06-16
    • 1970-01-01
    • 2019-09-23
    相关资源
    最近更新 更多