【发布时间】:2021-02-28 02:16:36
【问题描述】:
我有一个包含以下列的 Pandas 数据框:
SecId Date Sector Country
184149 2019-12-31 Utility USA
184150 2019-12-31 Banking USA
187194 2019-12-31 Aerospace FRA
...............
128502 2020-02-12 CommSvcs UK
...............
SecId & Date 列是索引。我想要的是以下..
SecId Date Aerospace Banking CommSvcs ........ Utility AFG CAN .. FRA .... UK USA ...
184149 2019-12-31 0 0 0 1 0 0 0 0 1
184150 2019-12-31 0 1 0 0 0 0 0 0 1
187194 2019-12-31 1 0 0 0 0 0 1 0 0
................
128502 2020-02-12 0 0 1 0 0 0 0 1 0
................
解决这个问题的有效方法是什么?每天对原始数据进行非规范化处理,可以有数百万行。
【问题讨论】:
-
检查 pandas.get_dummies
-
如果您需要能够使用不同的数据集重复这些步骤以获得相同的列布局,我不会使用
pandas.get_dummies。在这种情况下,您可以使用 scikit-learn 中的 one-hot-encoder 类。但如果你真的必须做一次,get_dummies是最简单、最快的方法。
标签: python pandas pivot-table multi-index