【问题标题】:Managing MultiIndex Dataframe objects管理 MultiIndex 数据框对象
【发布时间】:2017-05-15 16:23:21
【问题描述】:

所以,使用分组数据帧的另一个问题让我感到非常困惑......

我已将聚合字典定义为:

aggregations_level_1 = {
       'A': {
           'mean': 'mean',
        }, 

       'B': {
           'mean': 'mean',
        },  
    }

现在我有两个分组的 DataFrame,我使用上述方法聚合,然后加入:

grouped_top = 
     df1.groupby(['group_lvl']).agg(aggregations_level_1)
grouped_bottom = 
     df2.groupby(['group_lvl']).agg(aggregations_level_1)

加入这些:

df3 = grouped_top.join(grouped_bottom, how='left', lsuffix='_top_10', 
rsuffix='_low_10')

                      A_top_10        A_low_10     B_top_10        B_low_10
                      mean            mean         mean            mean
group_lvl                                      
    a                 3.711413    14.515901        3.711413        14.515901
    b                 4.024877    14.442106        3.694689        14.209040
    c                 3.694689    14.209040        4.024877        14.442106

现在,如果我调用 index 和 columns 我有:

print df3.index
    >> Index([u'a', u'b', u'c'], dtype='object', name=u'group_lvl')

print df3.columns
    >> MultiIndex(levels=[[u'A_top_10', u'A_low_10', u'B_top_10', u'B_low_10'], [u'mean']],
       labels=[[0, 1, 2, 3], [0, 0, 0, 0]])

所以,看起来我有一个索引为a,b,c 的常规 DataFrame 对象,但每一列都是一个 MultiIndex 对象。这是正确的解释吗?

  • 如何切片和调用它?假设我只想为所有a,b,c 提供A_top_10, A_low_10
  • A_top_10, B_top_10 用于ac

我很困惑,所以任何整体帮助都会很棒!

【问题讨论】:

    标签: pandas dataframe multi-index


    【解决方案1】:

    需要slicers,但首先按sort_index 对列进行排序,否则会出错:

    UnsortedIndexError: 'MultiIndex Slicing 要求索引是完全 lexsorted tuple len (1), lexsort depth (0)'

    df = df.sort_index(axis=1)
    
    idx = pd.IndexSlice
    df1 = df.loc[:, idx[['A_low_10', 'A_top_10'], :]]
    print (df1)
                A_low_10  A_top_10
                    mean      mean
    group_lvl                     
    a          14.515901  3.711413
    b          14.442106  4.024877
    c          14.209040  3.694689
    

    还有:

    idx = pd.IndexSlice
    df2 = df.loc[['a','c'], idx[['A_top_10', 'B_top_10'], :]]
    print (df2)
               A_top_10  B_top_10
                   mean      mean
    group_lvl                    
    a          3.711413  3.711413
    c          3.694689  4.024877
    

    编辑:

    所以,看起来我有一个索引为 a、b、c 的常规 DataFrame 对象,但每一列都是一个 MultiIndex 对象。这是正确的解释吗?

    我认为非常接近,最好说我在columns 中有MultiIndex

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2013-09-10
      • 2018-01-01
      • 2012-06-26
      • 2012-08-25
      • 2016-02-01
      • 2021-02-06
      • 2018-01-15
      相关资源
      最近更新 更多