【问题标题】:Pandas Pivot table converts float to intPandas Pivot 表将 float 转换为 int
【发布时间】:2016-07-19 21:54:54
【问题描述】:

在将数据框转换为数据透视表时,我发现了 pandas 的奇怪行为。

import pandas as pd
df = pd.DataFrame({'car_id': {0: 'Trabant', 1: 'Buick', 2: 'Dodge'}, 'car_order': {0: 2, 1: 1, 2: 14}, 'car_name': {0: 'Trabant', 1: 'Buick', 2: 'Dodge'}, 'car_rank': {0: 111111317.29, 1: 1111112324.0, 2: 1111112324.5}})
table = df.pivot_table(index=['car_id', 'car_name', 'car_order'], columns=[],values=['car_rank'], fill_value='',dropna=True)
print table

df1 = pd.DataFrame({'car_id': {0: 'Trabant', 1: 'Buick', 2: 'Dodge'}, 'car_order': {0: 2, 1: 1, 2: 14}, 'car_name': {0: 'Trabant', 1: 'Buick', 2: 'Dodge'}, 'car_rank': {0: 17.29, 1: 24.0, 2: 24.5}})
table1 = df1.pivot_table(index=['car_id', 'car_name', 'car_order'], columns=[],values=['car_rank'], fill_value='',dropna=True)
print table1

结果输出:

Table
                              car_rank
car_id  car_name car_order            
Buick   Buick    1          1111112324
Dodge   Dodge    14         1111112324
Trabant Trabant  2           111111317

Table 1
                            car_rank
car_id  car_name car_order          
Buick   Buick    1             24.00
Dodge   Dodge    14            24.50
Trabant Trabant  2             17.29

你知道为什么 Table 中的值被转换为 int 而 Table 1 中的值保持为浮点数吗?

熊猫 0.18.0 , python 2.7.9

【问题讨论】:

  • 如果您检查值的 dtypes,您将看到 int 而不是 float。

标签: python pandas dataframe type-conversion pivot-table


【解决方案1】:

这是我对pandas 0.18.0 的观察结果:

pandas/tools/pivot.py的源代码pivot_table()的定义行:141-142:

if fill_value is not None:
    table = table.fillna(value=fill_value, downcast='infer')

这正是你的旋转 DF 发生的事情:

In [78]: df.fillna('', downcast='infer')
Out[78]:
    car_id car_name  car_order    car_rank
0  Trabant  Trabant          2   111111317
1    Buick    Buick          1  1111112324
2    Dodge    Dodge         14  1111112324

类型:

In [48]: df.fillna('', downcast='infer').dtypes
Out[48]:
car_id       object
car_name     object
car_order     int64
car_rank      int64
dtype: object

有趣的是——如果你正确使用pivot_table()(即用于旋转)——它可以正常工作:

In [81]: df.pivot_table(index=['car_id', 'car_order'], columns=['car_name'], values=['car_rank'],dropna=True, fill_value='')
Out[81]:
                       car_rank
car_name                  Buick         Dodge      Trabant
car_id  car_order
Buick   1         1111112324.00
Dodge   14                      1111112324.50
Trabant 2                                     111111317.29

PS 我还是不明白你为什么要以这种奇怪的方式使用 pivot_table - 你要达到什么目的?

【讨论】:

  • 好的,这只是使用数据透视表的示例,它取决于用户输入。在调用数据透视表之前将 DF 更改为 df = df.fillna(value='', inplace=False, downcast=None) 然后在没有 fillna 的情况下调用数据透视表
  • 所以downcast='infer' 被视为float32 而不是float64?或者至少这似乎是隐含的,因为 float32 有大约 7 位精度,而 df 有问题,但 df1 没有。
  • @JohnE,将其转换为 int64 - 请参阅我的更新答案 - Types
  • 没错。我要注意的是,fillna 似乎“足够聪明”,知道将 df1 向下转换为 int64 会丢失信息,但对于 df 来说还不够“聪明”。这与 fillna 将数字视为 float32 而不是 float64 大致一致,但我只是在这里推测这是原因。
猜你喜欢
  • 2021-11-02
  • 2017-03-08
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-05-05
相关资源
最近更新 更多