【问题标题】:converting parquet file to pandas and then querying gives error将镶木地板文件转换为熊猫然后查询会出错
【发布时间】:2018-02-28 19:33:10
【问题描述】:

我正在尝试查询数据框以获取列的平均值,并且我将 parquet 文件转换为 pandas 来执行此操作。我收到错误 TypeError('Could not convert %s to numeric' % str(x)) 这似乎是指列中的“年龄”一词。

数据框如下所示:

         _c0     _c1  _c2    
    0  RecId   Class  Age   
    1      1    1st    29   
    2      2    1st     2   
    3      3    1st    30 

我的代码是:

    import pyarrow 
    import pandas
    import pyarrow.parquet as pq

    df = pq.read_table("file.parquet").to_pandas()
    average_age = df["_c2"].mean()

我尝试过使用

    df = df(skiprows=1)

但这给出了错误“TypeError: 'DataFrame' object is not callable”

如何跳过包含“年龄”的行或将其删除,这与从镶木地板文件中读取它有关还是这是一个直接的 Pandas 问题?

【问题讨论】:

    标签: python pandas parquet


    【解决方案1】:

    您可以只使用 pandas 索引来删除第一行:

    df = df.iloc[1:,:]
    

    【讨论】:

    • 这符合我的要求,非常感谢。不幸的是,我意识到这毕竟不是问题。在某些时代有一些 NA 标记,这一定是它的原因。我将研究如何摆脱这些或在另一个线程中重新提问。
    猜你喜欢
    • 1970-01-01
    • 2022-11-24
    • 2018-01-04
    • 2019-10-02
    • 2021-02-28
    • 2014-11-25
    • 2018-12-01
    • 1970-01-01
    • 2017-04-25
    相关资源
    最近更新 更多