【发布时间】:2016-06-16 01:45:45
【问题描述】:
我有一个具有以下结构的熊猫数据框:
import numpy as np
import pandas as pd
df = pd.DataFrame(np.arange(32).reshape((4,8)),
index = pd.date_range('2016-01-01', periods=4),
columns=['male ; 0', 'male ; 1','male ; 2','male ; 4','female ; 0','female ; 1','female ; 2','female ; 3',])
列名很乱,标题名称中包含两个变量,以及原始电子表格中的残留标点符号。
我想要做的是在我的数据框中设置一个名为性别和年龄的列 MultiIndex。
我尝试像这样使用pd.MultiIndex.from_tuples:
columns = [('Male', 0),('Male', 1),('Male', 2),('Male', 3),('Female', 0),('Female', 1),('Female', 2),('Female', 3)]
df.columns = pd.MultiIndex.from_tuples(columns)
然后命名列索引:
df.columns.names = ['Sex', 'Age']
这给出了我想要的结果。但是,我的数据框每个性别的年龄都超过 100,所以这不是很实用。
有人可以指导我如何以编程方式从元组中设置 MultiIndex 列。
【问题讨论】: