【问题标题】:Value filter in pandas dataframe keeping NaN熊猫数据框中的值过滤器保持 NaN
【发布时间】:2020-05-22 07:18:19
【问题描述】:

我正在尝试从小于某个值的数据框中过滤数据。如果没有 NaN,那么它的工作正常。但是当有一个 nan 时,它会忽略 NaN 值。我想一直包含它的小于或大于比较值无关紧要。

import pandas as pd
import numpy as np

df = pd.DataFrame(
    {
        'index': [1, 2, 3,  4,  5,  6,   7,  8, 9],
        'value': [5, 6, 7, np.nan, 9, 3, 11, 34, 78]
    }
)

df_chunked = df[(df['index'] >= 1) & (df['index'] <= 5)]

print('df_chunked')
print(df_chunked)

df_result = df_chunked[(df_chunked['value'] < 10)]
# df_result = df_chunked[(df_chunked['value'] < 10) | (df_chunked['value'] == np.isnan(df_chunked['value']))]

print('df_result')
print(df_result)

在上面的结果中显示了 5,6,7,9。但我也想要那里的南。我试过了

df_result = df_chunked[(df_chunked['value'] < 10) | (df_chunked['value'] == np.isnan(df_chunked['value']))]

但它不起作用。

我该怎么做?

【问题讨论】:

    标签: python pandas filter data-science nan


    【解决方案1】:

    使用 not 运算符:~

    df_chunked[~(df_chunked['value'].ge(10))]
    #df_chunked[~(df_chunked['value']>=10)] #greater or equal(the same)
    
       index  value
    0      1    5.0
    1      2    6.0
    2      3    7.0
    3      4    NaN
    4      5    9.0
    

    为什么?

    因为逻辑运算只是忽略NaN的值并将其视为False,始终如您在以下数据框中看到的那样,那么如果您想避免使用series.isna ( 避免不必要的额外代码)并简化您的代码,只需使用~的逆逻辑

    print(df.assign(greater_than_5 = df['value'].gt(5),
              not_greater_than_5 = df['value'].le(5)))
    
    
       index  value  greater_than_5  not_greater_than_5
    0      1    5.0           False                True
    1      2    6.0            True               False
    2      3    7.0            True               False
    3      4    NaN           False               False
    4      5    9.0            True               False
    5      6    3.0           False                True
    6      7   11.0            True               False
    7      8   34.0            True               False
    8      9   78.0            True               False
    

    【讨论】:

      【解决方案2】:

      试试:

      df_result = df_chunked[(df_chunked['value'] < 10) | (df_chunked['value'].isna())]
      df_result 
         index  value
      0      1    5.0
      1      2    6.0
      2      3    7.0
      3      4    NaN
      4      5    9.0
      

      【讨论】:

      • (df_chunked['value'].isna()) 这里不需要,看我的回答
      • df_chunked[~(df_chunked['value']&gt;=10)] 也可以
      【解决方案3】:

      您可以简单地定义您的 df_result 如下:

      df_result = df_chunked[(df_chunked["value"] < 10) | (df_chunked["value"].isnull())]
      

      这行得通。

      【讨论】:

        猜你喜欢
        • 2014-02-25
        • 1970-01-01
        • 1970-01-01
        • 2019-08-09
        • 2014-09-22
        • 1970-01-01
        • 2016-08-31
        • 2013-06-09
        相关资源
        最近更新 更多